新京报贝壳财经讯(记者罗亦丹)8月26日晚,阿里发布并同步开源千问最新模型 Qwen3.8-Flash。该模型采用全新下一代架构,千亿总参数仅激活60亿(6B)即可获得超越Claude Opus4.6的前沿性能,创下模型效率的全球新基准。得益于架构和训练的全面革新,Qwen3.8-Flash训练成本较Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,价格最低至DeepSeek-V4-Flash的1/3。Qwen3.8-Flash今晚将首发上线“千问办公”,开发者和企业也可通过千问AI平台获取新模型API服务。
具体来看,Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,Transformer参数125B仅激活6B,性能表现超越Opus4.6、接近Opus4.8。
Qwen3.8-Flash出色的模型能力得益于其革新的模型架构和训练方案。模型采用了与此前所有千问大模型完全不同的全新架构:在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上;在模型内部信息传递方面,引入自研的 Gated Residual 方法,将传统Transformer的1条信息主通道拆分并拓展为4条,让模型可根据需求动态决定读写信息,信息传递更高效,训练也更稳定;在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址,在每次Token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的 “记忆指南手册”,模型参数扩展效率更高;在模型优化方面,模型结构和训练优化协同进行,收敛效率和训练吞吐大幅提升。
Qwen3.8系列技术创新,直接带来了训练和推理的成本大幅下降。Qwen3.8-Flash性能与上一代Qwen3.7-Plus接近,但仅用九分之一的资源便完成了训练。
编辑 岳彩周
校对 杨许丽






