用于高级综合的智能体工厂:通用编程智能体在硬件优化中能走多远?
人工智能
2026-05-04 v2 硬件体系结构
机器学习
摘要
我们展示了一项实证研究,探讨通用编程智能体——无需硬件特定训练——能从高级算法规范中优化硬件设计到什么程度。我们引入了一种智能体工厂,这是一个两阶段流水线,用于构建和协调多个自主优化智能体。在第一阶段,流水线将设计分解为子内核,使用编译指示和代码级变换独立优化每个子内核,并在面积约束下构建整数线性规划(ILP)以组装全局有前景的配置。在第二阶段,它在 ILP 最优解之上启动 N 个专家智能体,每个智能体探索子内核分解未能捕捉的跨函数优化,如编译指示重组、循环融合和存储重构。我们在 HLS-Eval 和 Rodinia-HLS 的 12 个内核上使用 Claude Code(Opus 4.5/4.6)和 AMD Vitis HLS 评估了该方法。从 1 个扩展到 10 个智能体相对于基线实现了平均 8.27 倍加速,在更难的基准上增益更大:streamcluster 超过 20 倍,kmeans 达到约 10 倍。在所有基准上,智能体一致地重新发现了已知的硬件优化模式而无需领域特定训练,且最佳设计往往并非来自排名最高的 ILP 候选方案,表明全局优化揭示了子内核搜索所遗漏的改进。这些结果确立了智能体扩展作为 HLS 优化的一个实用且有效的维度。
引用
@article{arxiv.2603.25719,
title = {Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?},
author = {Abhishek Bhandwaldar and Mihir Choudhury and Ruchir Puri and Akash Srivastava},
journal= {arXiv preprint arXiv:2603.25719},
year = {2026}
}