Qwen3.8-Flash-Next 在 NVIDIA GB300 NVL72 上探索智能体编程
NVIDIA Generativ21 天前
Qwen4 架构的提前预览
阿里巴巴发布了 Qwen3.8-Flash-Next 的模型权重,供开发者进行实验和评估。该模型被定位为即将到来的 Qwen4 架构预览,此次实验重点之一是观察其在智能体编程(Agentic Coding)场景中的表现。
多模态 MoE 架构
Qwen3.8-Flash-Next 是一个多模态混合专家模型(MoE)。
从公开的模型配置来看:
- 主模型规模为 125B 参数;
- 另外包含 51B N-gram Embeddings;
- 每个 Token 激活约 6B 参数。
这种设计意味着模型总体拥有较大的参数规模,但在实际处理每个 Token 时只激活其中一部分参数。
原生支持 26 万 Token 上下文
Qwen3.8-Flash-Next 的另一个关键特性是长上下文能力。模型原生上下文窗口达到 262,144 Token,并可进一步扩展至 100 万 Token。
对于智能体编程而言,长上下文能力具有直接的实验价值:编程智能体通常需要持续处理代码、项目文件以及多轮任务信息,更大的上下文窗口为这类工作负载提供了基础能力。
在 GB300 NVL72 上进行智能体编程实验
此次实验将 Qwen3.8-Flash-Next 与 NVIDIA GB300 NVL72 结合,用于探索 Agentic Coding 场景。
值得注意的是,目前公开信息将 Qwen3.8-Flash-Next 定位为供开发者实验和评估的架构预览。因此,相比将其直接视为成熟的 Qwen4 正式版本,更适合关注它展示出的架构方向、长上下文能力以及在智能体编程工作负载中的实验价值。
