XR-NPE:用于扩展现实感知工作负载的高吞吐混合精度 SIMD 神经处理引擎
硬件体系结构
2025-08-19 v1 人工智能
计算机视觉与模式识别
图像与视频处理
摘要
本工作提出 XR-NPE,一种面向扩展现实(XR)感知工作负载(如视觉惯性里程计、目标分类和眼动提取)的高吞吐混合精度 SIMD 神经处理引擎。XR-NPE 首次支持 FP4、Posit(4,1)、Posit(8,0)和 Posit(16,1)格式,采用分层自适应混合算法实现,支持超低位精度显著降低内存带宽需求,并配套量化感知训练以实现最小精度损失。提出的可重构 Mantissa 乘法和 Exponent 处理电路(RMMEC)减少暗硅在 SIMD MAC 计算引擎中的比例,辅以选择性功率栅以降低能耗,实现算术密度提升 2.85 倍。XR-NPE 达到最高工作频率 1.72 GHz,面积 0.016 mm2,算术密度为 14 pJ,采用 CMOS 28nm工艺,相较于最先进的 MAC 方法降低 42% 面积、38% 功耗。基于 AXI 接口的矩阵乘法协处理器相较于现代加速器消耗的 LUT 少 1.4 倍、FF 少 1.77 倍,能效提升 1.2 倍。该协处理器在 VIO 工作负载上实现能效提升 23%、计算密度提升 4%。XR-NPE 作为面向未来资源受限 XR 设备的可扩展、精度自适应计算引擎确立其地位。为保证结果可复现,完整代码已公开发布,供设计师和研究者轻松采用并发展其应用。https://github.com/mukullokhande99/XR-NPE
引用
@article{arxiv.2508.13049,
title = {XR-NPE: High-Throughput Mixed-precision SIMD Neural Processing Engine for Extended Reality Perception Workloads},
author = {Tejas Chaudhari and Akarsh J. and Tanushree Dewangan and Mukul Lokhande and Santosh Kumar Vishvakarma},
journal= {arXiv preprint arXiv:2508.13049},
year = {2025}
}