阿里通义即将发布 Qwen3-Next 系列模型_科技资讯

阿里通义即将发布 Qwen3-Next 系列模型

作者：心靈之曲浏览：发布日期：2025-09-11

[导读]:阿里通义Qwen团队通过HuggingFacetransformers库的PR 提交了对Qwen3-Next系列的支持，信息显示将有一款名为Qwen3-Next-80B-A3B-Instruct的模型

阿里通义 qwen 团队通过 hugging face transformers 库的 pr 提交了对 qwen3-next 系列的支持，信息显示将有一款名为 qwen3-next-80b-a3b-instruct 的模型。该系列定位为 “下一代基础模型”，主打极端上下文长度与参数效率。

据介绍，Qwen3-Next 系列模型在架构层面引入了三项核心创新。首先是 Hybrid Attention，它使用 Gated DeltaNet 和 Gated Attention 替代传统注意力机制，以实现高效的长文本建模。其次是 High-Sparsity MoE，将激活比例压缩至 1:50，大幅减少了单个 token 的 FLOPs 而不损失模型容量。最后是 Multi-Token Prediction，在预训练阶段同步预测多个 token，从而提升性能并加速推理。

此外，模型还辅以 zero-centered、weight-decayed layernorm 等多项稳定化改进，增强了训练的鲁棒性。

源码地址：点击下载

跑分破400万！vivo X300 Pro顶配全球首发双UF

字节跳动发布开源多模态模型 Mini-o3

免责声明：转载请注明出处：http://sczxchw.cn/news/114612.html

新闻动态

热门推荐

微博Q3净收入4.42亿美元最新月活跃用户数达5.78亿

马斯克：特斯拉Cybertruck是“外星科技”

哪些城市爱买特斯拉：杭州、上海、北京包揽前三名

年产千万台！特斯拉得州工厂将扩建造Optimus人形机器人

最新文章

阿里通义即将发布 Qwen3-Next 系列模型

猜你喜欢

新闻动态

热门推荐

微博Q3净收入4.42亿美元 最新月活跃用户数达5.78亿

马斯克：特斯拉Cybertruck是“外星科技”

哪些城市爱买特斯拉：杭州、上海、北京包揽前三名

年产千万台！特斯拉得州工厂将扩建造Optimus人形机器人

最新文章

阿里通义即将发布 Qwen3-Next 系列模型

猜你喜欢

微博Q3净收入4.42亿美元最新月活跃用户数达5.78亿