昌平实验室×华为开源TorchX:全球首个NPU原生全原子生物分子模型体系落地

来源:爱集微 #TorchX# #NPU原生# #全原子生物分子# #AI4S# #开源#
295

一、发布事件:从“适配GPU”到“NPU原生”的范式切换

2026年9月17日,昌平实验室携手华为联合发布TorchX,正式推出全原子生物分子模型体系。这是业界首个NPU原生的开源全原子生物分子模型体系,推理与训练代码全面适配昇腾NPU,模型权重按MIT许可向全球开放。官方将其定位为全球AI4S(AI for Science)领域首个NPU原生开源生物分子设计平台。

与此前大量“基于GPU生态开发、再向国产算力移植”的做法不同,TorchX从模型设计、算子融合到训练推理全流程均围绕昇腾NPU原生构建。昌平实验室与华为在发布中表示,此举意在打造“自主创新+前沿模型”的技术底座,打破商业壁垒,对降低生物医药领域AI应用门槛、促进科研资源共享和成果可复现具有重要示范意义。

开源范围上,昌平实验室已开放推理代码、训练代码、模型权重以及训练数据。这意味着全球研究者不仅可以免费使用预训练权重做推理,还可以基于公开训练数据和训练代码复现实验、二次开发或微调模型——这在当前前沿生物分子模型普遍收紧开放程度的背景下尤为难得。

二、三大核心模块:覆盖生物分子设计全链条

TorchX并非单一模型,而是一套覆盖“结构预测—结构评价—分子设计”完整闭环的模型体系,包含三个核心功能模块:TorchFold、TorchScore和TorchCraft。

(一)TorchFold:抗体-抗原复合物结构预测

TorchFold用于抗体-抗原复合物结构预测。模型保留了AlphaFold3的网络架构,但在训练策略上进行了三项关键创新:界面特异性坐标损失、高噪声扩散调度策略,以及两轮置信度筛选蒸馏。

通过上述策略,团队将非冗余抗体-抗原训练样本由约5000个扩展至24500个,训练样本量扩大至约5倍。在FoldBench基准测试上,成功率由34.0%提升至70.1%,提升幅度超过一倍。在五项不同来源、不同时间范围和不同抗原组成的抗体-抗原基准测试中,TorchFold均展现出稳定的高质量界面恢复能力。

(二)TorchScore:候选复合物结构快速评价

TorchScore作为结构评分模式,可跳过扩散生成模块,直接通过置信度通路对候选复合物进行评价。在生物分子设计的高通量筛选场景中,这一设计能够显著降低计算成本,帮助研究者快速从大量候选分子中锁定潜在结合界面,再交由实验验证。

(三)TorchCraft:预测器反演驱动的分子设计

TorchCraft通过预测器反演开展分子设计,实现了跨分子类型的统一全原子设计能力,可同时用于微型蛋白结合体、框架约束VHH(纳米抗体)、环肽和小分子结合口袋设计。

工程实现上,TorchCraft使用了可重入式梯度重计算技术。研发期间,昌平实验室与华为团队联合修复了Torch原生梯度重计算在当前模型下的显存泄漏问题。针对TorchCraft长序列场景,华为团队对FA(FlashAttention)算子进行了PSE反向计算功能补齐,使该算子在当前模型下可以正常使能,在显存优化和性能提升上均取得较好效果。

实验验证方面,针对IFNAR2、IL-7Rα等靶点的微型蛋白及VHH设计,均经生物层干涉法(BLI)验证达到纳摩尔级亲和力,且实验候选直接取自TorchCraft的输出结果——这意味着模型设计的分子无需人工大幅修饰即可通过物理实验验证其结合活性。

三、昇腾原生:从芯片到模型的端到端自主创新

TorchFold是业界首个基于昇腾NPU原生的全原子结构预测开源模型。华为与昌平实验室协同创新,通过蛋白质序列残基注意力算子融合、流水调度以及昇腾亲和性优化等方式,显著提升了推理训练速度并降低了显存占用。

(一)长序列推理的第一性矛盾与优化路径

TorchFold长序列推理面临的第一性矛盾,是二维Pair引发的激活张量显存占用呈二次方增长,由此带来显存与性能的双重瓶颈。针对这一挑战,华为团队依托AI4S智能引擎提出了昇腾亲和长序列推理优化方案,围绕显存与性能瓶颈开展系统性优化。

具体技术路径包括:多维混合并行、等价数据流重构、推理不变量缓存复用,通过这三项手段实现序列规模与推理效率的协同提升。目前,该方案已在昇腾上完成单卡4K级序列、整机10K级序列的推理验证。

(二)关键性能数据

在37aa~2002aa的测试用例中,单卡推理性能均获得1.7倍以上的显著提升;在支持单卡4K级序列推理的前提下,通过四卡并行推理可获得3.x倍的性能提升。未来,团队将持续探索更长序列的推理能力边界,并通过AscendSkills沉淀可复用的软硬件协同优化策略,向同类Fold模型推广,将昇腾打造为生科领域坚实的算力底座。

全原子生物分子模型体系TorchX运行于华为智算实验室方案所构建的自主算力底座之上。华为表示,将以这一算力底座为TorchX创新筑牢智能底座,进一步提升科研效率,推动科研智能化转型,助力AI4S落地。

四、产业意义:打破商业壁垒,降低AI制药门槛

当前,全球AI4S领域正面临一个结构性矛盾:一方面,AlphaFold系列等前沿模型持续刷新结构预测精度;另一方面,模型开放程度正在收窄,部分商业模型闭源或限制商用,中小实验室和初创团队难以平等使用最先进的生物分子设计工具。TorchX的发布正是对这一现状的直接回应。

昌平实验室AI科学家刘钰此前在公开演讲中曾将TorchX生态的核心理念概括为“开源放大模型影响力”。与仅开放推理权重的模式不同,TorchX同时开放了训练代码和训练数据,使研究者能够真正参与到模型改进的闭环中,而不仅仅是作为下游使用者。

对生物医药产业而言,这一开源体系的价值体现在多个层面:其一,降低了AI辅助药物发现的算力门槛和模型使用成本,使更多科研机构和初创企业能够基于全原子模型开展抗体设计、蛋白工程和小分子药物研发;其二,MIT许可的宽松条款允许商业使用和修改,为后续产业化落地预留了空间;其三,NPU原生的技术路线为国产算力在生命科学AI场景中的规模化应用提供了可复制的范式。

华为方面表示,将聚焦科研核心场景,助力国内上百万科研工作者通过AI更加高效地开展科研。此次华为与昌平实验室联合发布TorchX,被视为AI for Science领域“自主创新算力底座+前沿科研模型”协同创新的典范。未来,双方将共同推动AI工具从实验室走向生命科学产业应用,为新药发现、新蛋白设计及未来满足医学需求相关研究提供可复现、可扩展的基础模型支撑。

五、结语:AI4S中国方案的起点

TorchX的发布不仅是一次技术突破,更是一个生态共建的开端。从芯片级算子融合到模型层训练策略创新,从单卡4K长序列推理到四卡并行3.x倍加速,从训练数据到模型权重的全栈开源——这套体系首次完整展示了“国产算力底座+前沿生物分子模型+全开放协议”三位一体的中国AI4S方案。

随着全球AI4S竞赛从算法精度比拼逐步转向生态和落地能力的较量,TorchX能否真正带动国内生物分子设计社区形成活跃的二次开发与产业转化,仍有待时间检验。但至少在9月17日这一天,昌平实验室与华为已经为全球研究者提供了一个基于自主算力、完全开放、可复现的起点。

责编: 爱集微
来源:爱集微 #TorchX# #NPU原生# #全原子生物分子# #AI4S# #开源#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...