中文

AutoNeural: 为 NPU 推理协同设计视觉-语言模型

计算与语言 2025-12-09 v2

摘要

虽然神经网络处理单元(NPU)为边缘 AI 提供了高理论效率,但针对 GPU 优化的最先进的视觉-语言模型(VLM)在这些平台上往往表现不佳。我们将这种硬件-模型不匹配归因于两个主要因素:视觉 Transformer(ViT)的量化脆弱性以及自回归注意力机制的 I/O 密集特性,后者无法充分利用 NPU 的高算术吞吐能力。为弥合这一差距,我们提出了 AutoNeural,一种专为整数-only 推理而协同设计的 NPU 原生 VLM 架构。我们将标准 ViT 编码器替换为采用深度可分离卷积的 MobileNetV5 风格骨干网络,确保有界的激活分布以实现稳定的 INT4/8/16 量化。作为补充,我们的语言骨干网络将状态空间模型(SSM)原理与 Transformer 层相结合,采用高效的门控卷积以实现线性时间复杂度。这种混合设计消除了生成过程中键值缓存带来的沉重内存 I/O 开销。我们的方法带来了显著的效率提升,与传统基线相比,视觉编码器的量化误差降低高达 7 倍,端到端延迟降低 14 倍。AutoNeural 还实现了 3 倍的解码速度和 4 倍的更长上下文窗口。我们通过在 Qualcomm SA8295P SoC 上的真实汽车案例研究验证了这些改进,证明了座舱应用的实时性能。我们的结果表明,针对 NPU 约束重新思考模型拓扑是实现鲁棒多模态边缘智能的前提条件。

关键词

引用

@article{arxiv.2512.02924,
  title  = {AutoNeural: Co-Designing Vision-Language Models for NPU Inference},
  author = {Wei Chen and Liangmin Wu and Yunhai Hu and Zhiyuan Li and Zhiyuan Cheng and Yicheng Qian and Lingyue Zhu and Zhipeng Hu and Luoyi Liang and Qiang Tang and Zhen Liu and Han Yang},
  journal= {arXiv preprint arXiv:2512.02924},
  year   = {2025}
}