中文

eIQ中子:通过集成NPU和编译器创新重新定义边缘AI推理

硬件体系结构 2025-09-19 v1 人工智能 机器学习

摘要

神经处理单元(NPU)是实现资源受限边缘环境中高效AI推理的关键。虽然峰值tera运算次数(TOPS)常用于衡量性能,但它不能很好地反映实际性能,通常与更高的晶体管成本相关。为了解决这个问题,架构师必须专注于最大化计算利用率,同时不牺牲灵活性。本文提出了eIQ中子高效NPU,该NPU集成到一款主流MPU中,并配合 co-designed 编译器算法。该架构采用灵活的数据驱动设计,编译器使用受限编程方法根据工作负载特性优化计算和数据移动。在标准AI基准测试中,我们的解决方案在相同TOPS和内存资源下,相较于领先的嵌入式NPU和编译器堆栈,平均加速1.8倍(峰值4倍)。即使在NPU计算和内存资源为数倍于我们的解决方案时,中子也能实现最高3.3倍的性能。

关键词

引用

@article{arxiv.2509.14388,
  title  = {eIQ Neutron: Redefining Edge-AI Inference with Integrated NPU and Compiler Innovations},
  author = {Lennart Bamberg and Filippo Minnella and Roberto Bosio and Fabrizio Ottati and Yuebin Wang and Jongmin Lee and Luciano Lavagno and Adam Fuks},
  journal= {arXiv preprint arXiv:2509.14388},
  year   = {2025}
}

备注

Submitted to IEEE Transactions on Computers