AdaPerceiver:具有自适应宽度、深度与标记的Transformer
计算机视觉与模式识别
2025-11-25 v1 机器学习
摘要
现代Transformer架构在各类任务和领域中实现了卓越的性能,但在推理阶段的计算分配方式仍显僵化。实际部署往往需要模型适应多样化的硬件和延迟约束,而大多数动态计算方法仅沿单一维度进行调整——例如减少标记数量。我们提出了一种新颖能力:AdaPerceiver,是首个在单个模型中实现深度、宽度与标记三维统一自适应的Transformer架构。我们提出支持沿这些维度自适应的架构,并配合高效的联合训练方案,确保模型在各种配置下均保持性能。我们在图像分类、语义分割和深度估计任务上评估了AdaPerceiver。在图像分类任务中,AdaPerceiver将准确率-吞吐量帕累托前沿向前扩展。其实现85.4%的准确率,同时比FlexiViT-L高出36%的吞吐量。在密集预测任务中,AdaPerceiver在语义分割和深度估计上分别仅使用约1/26的参数计算量(浮点运算),即可达到ViT-H/14的性能。最后,我们展示当AdaPerceiver配合策略使用时,可在保持ImageNet1K准确率(±0.1个百分点)的同时,将浮点运算减少24%-33%。
引用
@article{arxiv.2511.18105,
title = {AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens},
author = {Purvish Jajal and Nick John Eliopoulos and Benjamin Shiue-Hal Chou and George K. Thiruvathukal and Yung-Hsiang Lu and James C. Davis},
journal= {arXiv preprint arXiv:2511.18105},
year = {2025}
}