壁仞科技与上海交通大学联合提出的双粒度监督方法,作为 SUPACODE™ 核心算法之一,让 AI 从“会写 GPU 代码”走向“理解硬件、适配生态、优化性能”。
高性能GPU算子是训练和推理系统把芯片算力转化为实际吞吐的基础组件。与通用代码不同,GPU kernel 还受到线程组织、内存访问、同步和启动配置等隐式执行约束影响;代码“能编译”并不等于“能正确运行”,更不等于“性能达标”。
针对这一长期难题,壁仞科技与上海交通大学联合提出“双粒度监督方法”即CUDA/SUPA 敏感指令微调(CUDA/SUPA-Sensitive Instruction Tuning,CuSeT)。该方法把GPU代码中的执行敏感结构显式纳入监督学习,在token级进行筛选监督,并依据region级置信度对样本重加权,在轻量化SFT后训练框架内提升模型生成可执行、可验证算子的能力。考虑到公开CUDA语料与基准更加丰富,研究首先在公开CUDA语料和CUDABench等基准上完成方法实现与算法验证,再将这一监督机制适配至 BIRENSUPA™ 编程平台,为SUPA算子开发提供模型层支撑。
“双粒度监督方法”是壁仞科技SUPACODE™ 的核心算法之一,作用于GPU 编程模型训练与算子生成环节。依托SUPACODE™的多智能体编排、编译与调试工具链、Profiler以及硬件反馈闭环,研究成果能够服务模型适配、算子开发和性能优化等工程任务。
技术速览 | CuSeT = 执行敏感 token 监督 + 区域感知样本重加权;SUPACODE™ = 模型、工具链与硬件反馈组成的全栈 GPGPU 编程智能体平台。
该核心算法已投稿至EMNLP 2026并被录用为Findings。
EMNLP(Conference on Empirical Methods in Natural Language Processing,自然语言处理实证方法会议)由国际计算语言学协会(ACL)旗下 SIGDAT 主办,与 ACL、NAACL 并列为全球自然语言处理与人工智能领域最具声誉和影响力的“三大顶会”之一。会议尤其注重算法在复杂真实工业与业务场景中的工程落地、数据实证与严谨验证,长期汇聚了 Google、Meta、微软、OpenAI 等全球顶尖科技企业与科研院校的最前沿技术成果。

EMNLP 2026投稿系统录用结果:Submission 7913获录用为Findings

EMNLP 2026 Decision Notification:Findings录用率14.3%
从 GPU 执行约束出发,重新理解算子生成
GPU 算子中的变量名和注释通常不会改变执行结果,但线程与线程块映射、数据在寄存器—共享内存—全局内存之间的移动、同步位置、资源边界以及 kernel 启动配置一旦偏离约束,就可能导致编译失败、非法访存或功能错误。最终需要回答的不是“代码像不像”,而是“能不能跑、跑得对不对、跑得快不快”。研究团队认为这类与硬件执行约束紧密耦合的代码片段具有“CUDA/SUPA敏感性”(CUDA/SUPA sensitivity)。
现有大模型在 GPU 代码生成上的核心问题并非完全“不懂 GPU”,而是缺少对不同代码片段重要性的精细建模。标准监督微调(SFT)通常对目标序列中的 token 使用统一损失权重,难以区分一般文本与执行关键结构。为验证这种差异,研究团队依据内存访问、线程组织、同步和启动配置等约束识别执行敏感 token,并分析模型的 next-token 预测概率。结果显示:大多数执行敏感 token 处于高置信度区间;少量低置信度执行敏感 token 则连续聚集成区域,集中出现在共享内存分配、线程索引计算和启动配置等结构中。两类 token 的置信度分布在 KS 检验下呈显著差异(p = 4.6 × 10^-39),为以置信度引导监督提供统计依据。
在窗口长度64、步长1的样本分析中,74.47% 的样本至少包含一个低置信度窗口;这些窗口中有 91.18% 对应执行敏感代码结构。由此得到的关键判断是:监督策略既要利用高置信度的执行敏感 token,也要保留低置信度但对执行至关重要的区域,不能只在单一 token 粒度上做筛选。
从 Token 到 Region 的双粒度监督后训练方法
CuSeT是一种面向 GPU kernel 生成的轻量化后训练方法。它在简单、稳定的 SFT 框架内引入 CUDA/SUPA 敏感性建模,不依赖多轮 Agentic 搜索或复杂的多阶段强化学习流程,将训练预算集中到真正决定算子可执行性的代码结构。
自适应 token 级掩码
CuSeT 首先计算每个目标 token 的 next-token 预测概率,并构建两类互补信号:置信度掩码优先保留高置信度 token 的监督,降低低置信度、非执行敏感 token 带来的噪声;CUDA/SUPA 敏感掩码则覆盖 kernel 主体和启动配置,即使这些位置置信度较低,也保留基本监督。两者合并后,模型既能稳定学习可靠模式,又不会丢掉关键但难预测的执行约束。
区域感知样本重加权
仅筛选 token 仍不足以覆盖跨多个 token 的执行逻辑。CuSeT 使用滑动窗口计算局部置信度;训练阶段以长度 256 的窗口识别样本中最具挑战性的低置信度区域,并据此提高样本权重,使训练更集中于共享内存、索引和启动配置等需要整体理解的结构。由此,token 级掩码回答“哪些 token 保留监督”,region 级重加权回答“哪些样本优先优化”。
方法创新的核心:把 GPU 的隐式执行约束转化为可学习、可评测的结构化监督信号,并将监督粒度从 token 扩展到 region。

CuSeT 双粒度监督框架:自适应 Token 级掩码与区域感知样本重加权
公开评测
功能正确率提升与生成效率对比
研究团队从开源代码仓库、公开数据集和 PyTorch 模块等来源构建 CUDA kernel 数据,并通过编译与功能校验筛选高质量样本,得到 6,278 组提示词—代码样本(prompt-response pairs)。评测采用 CUDABench Level 1,报告编译成功率、功能正确率和 Pass@k(k = 1、3;表示在 k 次采样中至少生成一个有效 kernel 的概率),并在 Qwen2.5-Coder、DeepSeek-Coder 和 Seed-Coder 等模型家族上进行比较。

CUDABench Level 1 多模型结果(编译成功率与功能正确率,单位:%)
在 Pass@1 功能正确率上,CuSeT 在三个模型家族上均高于对应的标准 SFT。Qwen2.5-Coder-7B-Instruct 从 55.0% 提升至 65.6%,较标准 SFT 提升 10.6 个百分点;DeepSeek-Coder-6.7B-Instruct 从 54.6% 提升至 63.2%,较标准 SFT 提升 8.6 个百分点;Seed-Coder-8B-Instruct 从 61.2% 提升至 67.8%,较标准 SFT提升 6.6 个百分点。不同模型上的增益幅度有所差异,但结果总体显示,执行敏感结构的针对性建模能够稳定改善功能正确率。
跨规模泛化:从小模型到大模型保持增益
进一步的规模实验显示,CuSeT 的改进能够跨越不同参数规模:在 Qwen3-4B 上,Pass@1 功能正确率由标准 SFT 的 51.2% 提升至 57.8%;在 Qwen2.5-Coder-32B-Instruct 上,则由 68.0% 提升至 75.6%。这表明执行敏感监督并不依赖单一模型架构,具有较好的可迁移性。

CuSeT 的跨规模泛化结果(CUDABench Level 1)
竞争性结果:在更少生成 token 下保持更高正确率
在同一 CUDABench Level 1 评测口径下,Qwen2.5-Coder-32B-Instruct 经 CuSeT 微调后,Pass@1 功能正确率达到 75.6%,Pass@3 达到 81.0%,平均每个样本生成 726 个 token。作为参照,KernelCoder 的 Pass@1 功能正确率为 70.6%、平均生成 5,379 个 token;Qwen3-Coder-Next 的对应结果为 63.4% 和 1,273 个 token。该结果体现了质量与生成长度之间的更优平衡;平均生成 token 数用于衡量生成效率,不等同于端到端时延或实际费用。

CuSeT 与前沿模型的功能正确率和生成效率对比(CUDABench Level 1)
评测说明:上述公开结果来自CUDABench Level 1,训练阶段使用 8 张 NVIDIA RTX 3090 Ti,用于评估 CuSeT 的算法增益;SUPACODE™ 在壁仞科技硬件上的适配与性能指标,在相应硬件在环测试中表现类似。
从“AI 写代码”到“AI 理解硬件”
双粒度监督方法进入 SUPACODE™ 工程闭环
SUPACODE™ 是壁仞科技面向GPGPU编程的全栈智能体平台,将工程知识、工具链和专家经验组织为可直接使用、可追踪验证的 AI 工程能力,贯通知识、模型、算子、编译器、调试器、Profiler 与交付验证,并与BIRENSUPA™ 软件栈协同工作。平台以自研全栈多智能体编排为基础,贯通模型适配、算子优化、精度对齐和性能验证;其中 GPU 编程专家模型(SUPACODER™)负责把自然语言需求转化为候选 kernel,研究提出的“双粒度监督方法”则作用于模型训练与算子生成环节,强化模型对执行敏感结构的学习。三者分工清晰,算法能力由平台工具链和验证闭环承接。
SUPACODE™ 的工程链路:需求理解 → 候选算子生成 → 编译与功能验证 → 通过 Profiler 和硬件反馈进行性能分析 → 迭代修复 → 经验与 Skills 沉淀。
在面向新模型、新算子和新框架的快速适配场景中,SUPACODE™ 把一次性的专家判断沉淀为可自动分析、可智能调优、可跨模型复用的工程能力,支持从模型适配到算子优化的端到端协作。本研究方法为这一闭环补上模型层的结构化监督,用于提升模型对执行约束相关代码的生成能力;工具链再用真实编译、测试和性能反馈进行验证,形成“生成—验证—修正—沉淀”的持续迭代。
这也是壁仞科技推进 Day0 适配的重要技术基础:面对快速变化的模型和算子需求,在追求模型发布当日完成适配与验证的同时,平台还将正确性、可复现性和后续优化纳入同一交付流程,使新能力更快进入可验证状态。
在壁仞科技面向主流模型的 Day0 适配实践中,SUPACODE™ 将自动化分析、智能算子调优、关键路径优化、精度对齐和性能验证组织为一体化流程;本研究方法补强其中的模型训练环节,使平台能够把算法创新更快转化为可复用的工程能力,有助于降低模型和软件栈迁移到国产芯片的适配门槛,加速高性能算子开发与模型性能优化。
壁仞科技 × 上海交通大学
产学研协同,以真实问题牵引联合创新
壁仞科技软件智能体研发团队作为公司面向新型智能计算系统的前沿研究力量,关注算法、架构与软件工具链的协同设计;上海交通大学在计算机体系结构和 AI 系统方向具有长期研究积累。双方在本次合作中把学术问题的抽象能力与国产 GPU 的工程场景连接起来,使研究从一开始就面向可验证、可落地的目标。
此次联合攻关形成了“产业问题提出—学术方法抽象—真实环境验证—平台化复用”的协同链条。双方围绕执行敏感性分析、算法设计、实验方法、真实 GPU 编程场景和软硬件约束开展协同,联合推进数据构建、工程化验证、评测指标与模型训练,并进一步推动研究结果进入 SUPACODE™的实际研发流程。
这种产学研合作的先进性,不在于简单叠加高校理论与企业资源,而在于双方围绕同一个可验证问题持续迭代:学术研究将 GPU 编程中的隐式约束提炼为可计算的监督信号,在产业化环节则通过编译器、测试工具和硬件反馈检验方法是否真正有效,并将验证结果反哺数据和模型训练,形成面向国产 GPU 软件生态的长期能力积累。
本研究成果的价值最终落在工程闭环上:它把执行约束转化为模型能够学习、平台能够验证的信号,为壁仞科技 SUPACODE™ 构建更可靠、更高效的 GPU 算子生成能力提供核心算法支撑,也为高校科研成果进入国产算力产业链提供了可复用的合作范式,推动 AI 从“会写 GPU 代码”走向“理解硬件、适配生态、优化性能”。