Vision-TTT:基于测试时训练的高效且富有表达力的视觉表征学习
计算机视觉与模式识别
2026-03-23 v2
摘要
学习高效且富有表达力的视觉表征一直是计算机视觉研究的热门方向。虽然 Vision Transformer(ViT)逐渐取代传统卷积神经网络(CNN)成为更可扩展的视觉学习器,但其应用受制于自注意力机制的二次复杂度。为解决这一挑战,我们引入新的线性时间序列建模方法测试时训练(TTT)到视觉领域,并提出 Vision-TTT 框架,将视觉序列视为数据集,并以新式自监督学习方式压缩视觉 token 序列。通过融合双数据集策略和基于 Conv2d 的数据集预处理,Vision-TTT 有效地将 vanilla TTT 扩展到具有全局感受野的 2D 视觉相关性建模。大量实验表明,\texttt{Vittt-T/S/B} 在 ImageNet 分类上分别实现了 77.7%、81.8%、82.7% 的 Top-1 准确率,也在下游任务中显著优于其对手。在 1280×1280 分辨率下,\texttt{Vittt-T} 的 FLOPs 降低 79.4%,运行速度提升 4.72 倍,内存使用减少 88.9%,相较于 DeiT-T。这些结果表明 Vision-TTT 在表达性和效率方面具备下一代通用视觉 backbone 的强大潜力。
引用
@article{arxiv.2603.00518,
title = {Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training},
author = {Quan Kong and Yanru Xiao and Yuhao Shen and Cong Wang},
journal= {arXiv preprint arXiv:2603.00518},
year = {2026}
}