现代工业与前沿科研的每一次突破,背后都站着规模庞大的高性能计算软件,而它们的底层往往压着一个极度吃算力、又绕不开的核心计算模式——Stencil 模板计算。无论是天气预报、地震勘探、电磁仿真还是材料模拟,本质都是用网格点邻居的加权组合反复刷新整张网格。这类计算访存密集、被内存带宽牢牢卡住脖子,往往吞掉整个应用大半的运行时间,它的快慢直接决定了一国关键工业与科研软件的效率。

过去要把 Stencil 优化到硬件物理极限,只能靠极度稀缺的 HPC 专家。那些编译器、代码生成器和自动调优系统虽然能自动出码、自动搜参,但优化算法本身仍要人设计和集成,换场景、换 Shape、换硬件就得重新手工接入,始终无法规模化。如今这个局面被撕开了一道缺口——面壁智能联合 OpenBMB 开源社区发布了全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,并直接开源。

image.png

据披露,ForgeStencil 仅用一周就完成了100多个真实工业和科学计算软件的自动优化,把单应用优化时长压缩到小时级,研发效率提升约100倍,而且能随算力规模并行放大。这意味着 Stencil 优化第一次摆脱人力束缚,规模化成为可能。

它最颠覆的地方在于双 Agent 驱动、零人工介入。人类只需扔进待优化的应用源码,从自动分析、定位热点、锻造 Kernel,到算子替换、正确性验证、集成回原应用,全程没有任何专家插手决策。系统由 Kernel Agent 与 App Agent 两块拼成:前者是算子锻造的科学家,自主研究并合成高性能 Kernel,针对主流 Stencil 类型、多种 Shape 和精度要求,构建专用算子矩阵,把数学表达写成逼近硬件极限的优雅代码;后者是工程落地的实干派,为每个真实应用单独锻造方案,定位热点、建立 GPU 基线、验证集成,最后用应用自带测例做端到端评测。

在算子对决中,ForgeStencil 拉来 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等知名框架同台比拼:同精度 fp32下取得几何平均2.35倍加速,混合精度 fp16读写再拿下额外1.95倍提速,即便在公认最难的变系数 Stencil 全 Shape 上,相比最优基线仍有1.34倍几何平均加速。

image.png

更狠的是它扎进了真实工业场景,而非停在理想化 Benchmark。在主流科学软件与权威基准上,约42% 的优化直接对应真实工业生产:hypre 结构化多重网格求解器库加速3.86倍,minisweep 核反应堆中子学输运加速5.78倍,gprMax 与 FDTD 电磁仿真加速2.47倍,RTM 逆时偏移油气地震成像加速1.81倍,道达尔 minimod 地震 mini-app 加速1.22倍,QuantLib 债券定价加速1.82倍,非笛卡尔 MRI 重建加速2.45倍,数字乳腺断层成像反投影加速1.63倍。石油公司、医疗设备、气象部门的实际生产负载,它都直接啃了下来。

相比人类专家经验锁在自己脑子里、难以共享,ForgeStencil 让大量并行 Agent 共用一个知识库,经验实时互通,实现智能的集体同步进化。这是面壁智能继5月 ForgeTrain 之后,基于 Forge Engineering 软件工程范式交出的又一成果,从自动生成代码迈向自动研究优化,从局部算子提速迈向真实应用部署。

短期看,存量工业软件的自动优化能小时级拿到接近硬件极限的实现,靠算力节约和研发压缩直接降本增效;长期看,当 CAE 仿真、地震成像、电磁与流体这些高端装备、能源勘探、芯片设计的数字底座被自动化优化,国产制造业升级便踩下了加速键。目前 ForgeStencil 已在 GitHub 开源,面壁智能向 HPC 学者、工业软件从业者和开源开发者发出共建邀请。