RAViT: 解析度自适应视觉转换器
计算机视觉与模式识别
2026-03-02 v1 机器学习
摘要
视觉转换器最近在计算机视觉中取得突破,在诸多应用方面显示出卓越的精度.然而,其计算成本非常高,与卷积神经网络等替代方法形成鲜明对比.为此,我们提出一种用于图像分类的 novel 框架,称为 RAViT,基于多分支网络在多个分辨率的同一图像副本上运行,以降低计算成本同时保持整体准确率.此外,我们的框架包括 early exit 机制,使模型具有自适应性,可在运行时选择准确率与计算成本之间的合适权衡.例如,在 two-branch 架构中,原始图像首先被调整以降低其分辨率,然后使用第一个转换器进行预测,该预测结果被重用并与原始尺寸图像一起,在第二个转换器上进行最终预测,计算量小于经典视觉转换器架构. early-exit 流程允许模型在中间分支处作出最终预测,进一步节省计算.我们在 CIFAR-10、Tiny ImageNet 和 ImageNet 上进行评估.我们获得了与经典视觉转换器模型相当的准确率,仅需约 70% 的 FLOPs.
关键词
引用
@article{arxiv.2602.24159,
title = {RAViT: Resolution-Adaptive Vision Transformer},
author = {Martial Guidez and Stefan Duffner and Christophe Garcia},
journal= {arXiv preprint arXiv:2602.24159},
year = {2026}
}