AIE4ML:用于面向下一代 AMD AI 引擎的神经网络编译端到端框架
机器学习
2026-01-19 v2 硬件体系结构
高能物理 - 实验
摘要
在 AMD Versal AI Engine(AIE)上高效执行 AI 推理具有挑战性,由于其紧密耦合的 VLIW 执行、显式数据路径以及局部内存管理。先前工作集中于针对第一代 AIE 内核优化,未解决跨 2D 数组的完整神经网络执行问题。本文中,我们提出了 AIE4ML,这是第一个针对 AIE-ML 代设备自动将 AI 模型转换为优化固件的综合框架,同时支持对更新的 AIE-MLv2 架构具有前向兼容性。在单内核层面,我们实现了接近架构峰值性能。在图和系统层面,我们提供了一种结构化的并行方法,可跨 2D AIE-ML fabric 扩展,并利用其专用内存瓶片在模型执行期间完全保持在片上。作为演示,我们设计了一种通用且高度效的线性层实现,内置对融合偏置添加和 ReLU 激活的支持。此外,由于本框架需要生成多层实现,我们的方法系统地推导出针对设备物理 2D 网格的确定性、紧凑且拓扑优化的放置方案,through a novel graph placement and search algorithm。最后,该框架无缝接受从高级工具如 hls4ml 或 PyTorch 导入的量化模型,同时保持位精确。
引用
@article{arxiv.2512.15946,
title = {AIE4ML: An End-to-End Framework for Compiling Neural Networks for the Next Generation of AMD AI Engines},
author = {Dimitrios Danopoulos and Enrico Lupi and Chang Sun and Sebastian Dittmeier and Michael Kagan and Vladimir Loncar and Maurizio Pierini},
journal= {arXiv preprint arXiv:2512.15946},
year = {2026}
}