中文

面向边缘 AI 部署的能源高效视觉 Transformer 推理

机器学习 2025-12-01 v1

摘要

Vision Transformer (ViT) 的日益增长部署要求评估方法超越准确率alone。我们提出了两个阶段的 pipeline,用于评估 ViT 能源效率,将设备无关的模型选择与设备相关的测量相结合。我们在 ImageNet-1K 和 CIFAR-10 上对 13 个 ViT 模型进行基准测试,分别在 NVIDIA Jetson TX2 (边缘设备)和 NVIDIA RTX 3050 (移动 GPU)上运行推理。设备无关阶段使用 NetScore 指标进行筛选;设备相关阶段使用可持续准确率指标 (Sustainable Accuracy Metric, SAM) 对模型进行排序。结果表明,诸如 LeViT_Conv_192 的混合模型在 TX2 相对于 ViT 基线可降低最高 53% 能耗 (例如 TX2/CIFAR-10 上 SAM5=1.44),而诸如 TinyViT-11M_Distilled 的蒸馏模型在移动 GPU 上表现突出 (例如 RTX 3050/CIFAR-10 上 SAM5=1.72,RTX 3050/ImageNet-1K 上 SAM5=0.76)。

关键词

引用

@article{arxiv.2511.23166,
  title  = {Energy-Efficient Vision Transformer Inference for Edge-AI Deployment},
  author = {Nursultan Amanzhol and Jurn-Gyu Park},
  journal= {arXiv preprint arXiv:2511.23166},
  year   = {2025}
}