中文

AscendOptimizer:用于Ascend NPU算子优化的决策式智能体

机器学习 2026-05-19 v2 人工智能

摘要

优化Ascend C (Ascend C)算子对于Ascend NPU来说较为困难,主要原因有两个。首先,与CUDA不同,该生态系统提供的公共内核数量有限。其次,性能取决于 coupled 两部分实现:控制数据移动的主机端分块程序,以及调度和流水化计算的内核程序。我们提出AscendOptimizer,这是一个决策式智能体,通过自身执行来构建缺失的优化知识。对于内核优化,AscendOptimizer通过受控方式移除优化措施来回溯强实现,然后保留对性能产生可测量影响的变更作为后续重写的可复用经验。对于主机端优化,它运行基于分层演化搜索的 profiling-in-the-loop 方式,直接从硬件反馈中寻找有效且快速的分块和数据移动配置。这种组合使智能体能够同步改进内核结构和主机端调度。在101个真实Ascend C算子的基准测试中,AscendOptimizer相较于开源基线实现了1.21倍的几何平均加速,并以53.47%的算子跑得比参考实现更快。在相同评估算子预算下,AscendOptimizer在几何平均加速、fast_p尾部加速比以及整体优化进程等方面, consistently 超过了Best-of-N采样和OpenEvolve。

关键词

引用

@article{arxiv.2603.23566,
  title  = {AscendOptimizer: Episodic Agent for Ascend NPU Operator Optimization},
  author = {Jiehao Wu and Zixiao Huang and Wenhao Li and Chuyun Shen and Junjie Sheng and Xiangfeng Wang},
  journal= {arXiv preprint arXiv:2603.23566},
  year   = {2026}
}