面向自动驾驶的异构边缘 GPU 上 Vision Transformer 的边缘物理 AI 部署
硬件体系结构
2026-07-12 v1 人工智能
摘要
自动驾驶汽车和智能机器等物理 AI 系统需要满足严格边缘延迟和能耗约束的基于 Transformer 的感知模型。然而,异构边缘 GPU 部署仍受限于未充分利用的硬件引擎和与加速器不兼容的算子,导致执行碎片化和每瓦吞吐量降低。本文提出了异构帧调度(H-FraDS),这是一种用于最新 NVIDIA 边缘 GPU 上 Transformer 推理的硬件感知帧调度方法。H-FraDS 使用固定调度比例在 GPU 和双深度学习加速器(DLA)核心之间路由帧,以在延迟和功耗约束下提高利用率。为了实现调度,通过重塑张量、用 tanh 近似误差函数(ERF)以及用有界 tanh 替换层归一化,使不兼容的 Transformer 组件适应 DLA 执行。适配后的模型保持了 92% 的 F1 分数,仅比原始模型降低 2%。光流加速器(OFA)进一步用于推理侧的光流估计。据作者所知,先前的工作尚未解决这些综合问题。使用 Swin Transformer 进行自动驾驶感知,H-FraDS 平衡调度(1:2)实现了 125.93 FPS,比独立适配 DLA 执行提速 2.36 倍,能效为 4.0 FPS/W,DLA 延迟约为 24 ms,满足 30 FPS 实时操作要求;GPU-DLA-OFA 方案实现了 2.02 倍的 DLA 吞吐量加速。
引用
@article{arxiv.2607.10942,
title = {Edge Physical AI Deployment of Vision Transformers on Heterogeneous Edge GPU Targeting Autonomous Vehicles},
author = {Ashiyana Abdul Majeed and Mahmoud Meribout and Neethu Joseph and Abel Kidane Haile and Mohammad Abdullah Al Faruque},
journal= {arXiv preprint arXiv:2607.10942},
year = {2026}
}
备注
14 pages, 15 figures, This work has been submitted to IEEE for possible publication