当前位置: 首页 > 新闻动态 > 科技资讯

阿里通义即将发布 Qwen3-Next 系列模型

作者:心靈之曲 浏览: 发布日期:2025-09-11
[导读]:阿里通义Qwen团队通过HuggingFacetransformers库的PR 提交了对Qwen3-Next系列的支持,信息显示将有一款名为Qwen3-Next-80B-A3B-Instruct的模型

阿里通义 qwen 团队通过 hugging face transformers 库的 pr 提交了对 qwen3-next 系列的支持,信息显示将有一款名为 qwen3-next-80b-a3b-instruct 的模型。该系列定位为 “下一代基础模型”,主打极端上下文长度与参数效率。

据介绍,Qwen3-Next 系列模型在架构层面引入了三项核心创新。首先是 Hybrid Attention,它使用 Gated DeltaNet 和 Gated Attention 替代传统注意力机制,以实现高效的长文本建模。其次是 High-Sparsity MoE,将激活比例压缩至 1:50,大幅减少了单个 token 的 FLOPs 而不损失模型容量。最后是 Multi-Token Prediction,在预训练阶段同步预测多个 token,从而提升性能并加速推理。

此外,模型还辅以 zero-centered、weight-decayed layernorm 等多项稳定化改进,增强了训练的鲁棒性。

源码地址:点击下载

免责声明:转载请注明出处:http://sczxchw.cn/news/114612.html

扫一扫高效沟通

多一份参考总有益处

免费领取网站策划SEO优化策划方案

请填写下方表单,我们会尽快与您联系
感谢您的咨询,我们会尽快给您回复!