ThinkingViT:面向弹性推理的Matryoshka思维视觉Transformer
计算机视觉与模式识别
2026-03-27 v3
摘要
视觉 Transformer (ViT) 虽然实现了最佳性能,但其固定的计算预算阻碍了在异构硬件上的可扩展部署。最近出现的Matryoshka 风格 Transformer 架构通过在单个模型中嵌套嵌套子网络来缓解此问题,但这些模型对所有输入分配相同计算量,无法有效应对不同复杂度的输入,导致效率低下。为此,我们引入ThinkingViT,一种嵌套 ViT 架构,采用分阶段思考机制,根据输入难度动态调整推理计算。ThinkingViT 首先激活最重要的注意力头子集,生成初始预测;若预测置信度超过预设阈值,即终止推理;否则,在相同主干网络中激活更大的注意力头子集,进行新的前向传播。此过程迭代进行,直至模型达到预设置信度水平或耗尽最大容量。为提升后续轮次的性能,我们引入了 Token Recycling 方法,将输入嵌入与前一阶段的嵌入融合。实验表明,ThinkingViT 在相同吞吐量下较现有嵌套基线提高最高可达 2.0 个百分点,在相同 GMACs 下提高最高可达 2.9 个百分点。我们展示,ThinkingViT 的主干保留设计使其可作为 ViT 在下游任务(如语义分割)中的即插式升级。我们还演示了 ThinkingViT 对其他架构(如 Swin Transformer)具有良好的迁移能力。源代码已公开于 https://github.com/ds-kiel/ThinkingViT。
引用
@article{arxiv.2507.10800,
title = {ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference},
author = {Ali Hojjat and Janek Haberer and Soren Pirk and Olaf Landsiedel},
journal= {arXiv preprint arXiv:2507.10800},
year = {2026}
}
备注
Accepted at CVPR'26, please cite the conference version