Day 0 适配 | 玄铁 RISC-V 处理器支持 Qwen3.8-27B,“Opus 级”Agent 能力落地

来源:XuanTie玄铁 #玄铁# #千问#
863

近日,阿里千问正式发布 Qwen3.8 系列开源模型。其中,Qwen3.8-27B 以 270 亿参数的“轻量级”体量,在 SWE-bench Pro(真实软件工程任务评测)等多个编程与 Agent 能力基准测试中,得分反超 Anthropic 公司的旗舰模型 Claude Opus 4.6 Max,被开发者称为“家用的 Opus”。玄铁第一时间完成 Qwen3.8-27B 的 Day 0 适配,打通模型推理链路,加速推进新一代大模型在高性能 RISC-V 平台落地。

Qwen3.8-27B

编程与 Agent 任务的“能力跃迁”

Qwen3.8-27B 是一款面向部署场景的 27B 稠密模型,重点提升编程、专业工作、长周期任务和多模态 Agent 能力。

相较于上一代 Qwen3.6-27B,Qwen3.8-27B 在编程与 Agent 能力上实现了全面跃升。在长程软件工程 DeepSWE 1.1、软件工程 QwenSWEBench、专业工作任务 JobBench、计算机操作 OSWorld-Verified 及浏览器操作 WebArena-Verified 等多项任务型评测中,得分均实现大幅提升,其中 DeepSWE 1.1 提升约 217%,QwenSWEBench 提升约 60%。这些提升高度集中于任务执行能力,模型不仅要生成代码或回答问题,更要在长时间内保持上下文、调用工具,并根据环境反馈持续完成任务。

Text Performance

VL Performance

注:以上百分比根据 Qwen 官方模型卡公布的 Qwen3.8-27B 与 Qwen3.6-27B 评测分数换算,表示对应评测项目的得分相对增幅。

从模型架构到硬件落地

玄铁承接 Qwen3.8-27B 推理负载完整路径

Qwen3.8-27B:混合架构与推理链路解析

Qwen3.8-27B 沿用 Qwen3.5 的混合架构。64 层语言模型以“3 层 Gated DeltaNet + 1 层 Gated Attention”为一组,共循环 16 组,并在各层注意力模块后连接 FFN。Gated DeltaNet、Gated Attention 和 FFN 交错执行,推理链路不再只有一种 Attention 计算。

其中,Gated DeltaNet 涉及投影、门控和状态更新;Gated Attention 包含 Q/K/V 投影、RoPE、Softmax 和 KV Cache 访问;FFN 则构成主要的矩阵计算负载。此外,RMSNorm、激活函数和数据转换等操作也会在每一层反复出现。模型运行时,矩阵计算、向量与归约计算、状态维护和数据访问需要连续衔接。

在编程、浏览器操作等 Agent 任务中,这条推理链路会被多次调用,工具返回结果也会不断加入上下文。任务持续时间越长,Decode 效率、缓存使用、内存访问和运行时调度的影响就越明显。因此,模型适配除了打通计算图,还需要分析完整推理链路中的热点和数据流。

玄铁 C950:三重算力支撑多元负载

玄铁 C950 在通用 CPU 计算能力基础上提供 RVV 向量扩展,并支持通过 AME 调用 TPE 矩阵计算引擎。在模型推理中,几类计算路径各有侧重:

  • Attention 投影、FFN 等矩阵密集型计算,主要由 Matrix 路径承接;

  • RMSNorm、RoPE、激活函数、规约和数据转换等操作,可以使用 RVV 进行向量化;

  • 模型控制、任务调度和不规则计算由通用 CPU 核处理,多核能力用于支撑完整推理链路。

值得注意的是,并非每类算子都固定绑定在某个计算单元。具体采用哪条路径,需要结合数据类型、张量形状和数据布局动态决策。

SHL:算子调度与数据处理的“中枢”

玄铁 SHL (Structure of Heterogeneous Library,中文名:ShiHulan)算子库负责把模型算子落到具体实现,是连接模型计算图与底层硬件的关键桥梁。以 MatMul、Linear 为例,SHL 可以根据数据精度和计算形态选择相应的矩阵计算内核;Softmax、RMSNorm 等算子则可以针对常见形态使用专用实现,并在条件变化时选择 RVV 或通用路径。

算子之外,数据处理也会影响实际性能。SHL 通过权重重排、输入预处理、缓冲区复用和算子融合,减少推理过程中的格式转换、内存申请和中间结果读写。在多核配置下,还需要同时处理任务划分、缓存复用和内存带宽等问题。

通过 SHL 的多层优化,再结合 C950 的多核并行能力,玄铁在 Qwen3.8-27B 上取得了以下实测性能: 在 64 核 C950 目标配置下,Qwen3.8-27B 的 Decode 性能达到 30 tokens/s 以上,TTFT 为 1.9 秒;Qwen3.8-2.4T-A95B 的 decode 吞吐为 7.2 tokens/s,TTFT 为 8.5 秒。

玄铁正持续优化多核并行与系统协同能力,推动 RISC-V 平台在大模型推理场景中的性能边界不断拓展。搭载玄铁 RISC-V 处理器的多款优选芯片也同步完成适配,如江原科技 D20、瑞芯微 RK1828 AI 协处理器等均已实现 Qwen3.8-27B 的高效运行。

欢迎前往玄铁官网,了解更多 SHL 相关信息:https://support.xrvm.cn/software/shl/

从 Day 0 适配到持续优化

玄铁 × 千问,引领“芯模协同”新范式

继 2026 年 1 月玄铁和千问共同发布“Powered by XuanTie,Qwen Inside”技术战略后,同年 3 月千问正式加入玄铁 RISC-V 无剑联盟,标志着“芯模协同” 全栈技术路径从战略构想走向产业实践。

从 Qwen3.6-Plus 到 Qwen3.8-27B ,玄铁 RISC-V 处理器全系列实现了对 Qwen 模型的 Day 0 适配,在 RISC-V 平台上完成从架构适配到性能优化的完整闭环。

面向未来,玄铁将不断完善工具链、算子库和推理框架,推动 RISC-V 成为支撑大模型创新与产业落地的重要技术底座,“Qwen Inside”将走进机器人、工业控制、车载终端、端侧智能等万千场景,让大模型真正“落地生根”。

Powered by XuanTie,Qwen Inside.

责编: 爱集微
来源:XuanTie玄铁 #玄铁# #千问#
THE END
关闭
加载

PDF 加载中...