面向移动设备的视觉Transformer推理延迟研究
计算机视觉与模式识别
2026-02-20 v2 机器学习
性能
摘要
鉴于机器学习技术在移动设备上取得的显著进展,尤其是在计算机视觉领域,本文定量研究了190个真实世界视觉Transformer(ViTs)在移动设备上的性能特征。通过与102个真实世界卷积神经网络(CNNs)进行比较,我们提供了洞察,解释影响ViT架构在移动设备上延迟的因素。基于这些洞察,我们构建了一个包含1000个合成ViTs测量延迟的数据集,这些合成ViT具有代表性的构建模块和来自两个机器学习框架和六个移动平台的先进架构。使用该数据集,我们表明新的ViT的推理延迟可被足够准确地预测,以满足实际应用的需求。
关键词
引用
@article{arxiv.2510.25166,
title = {A Study on Inference Latency for Vision Transformers on Mobile Devices},
author = {Zhuojin Li and Marco Paolieri and Leana Golubchik},
journal= {arXiv preprint arXiv:2510.25166},
year = {2026}
}