ViT$^3$: 解锁视觉测试时训练
计算机视觉与模式识别
2026-04-21 v2
摘要
测试时训练(Test-Time Training, TTT)最近作为高效序列建模的有前景方向。TTT 将注意力操作重新表述为在线学习问题,在测试时从关键值对中构建紧凑的内部模型。这种重新表述开辟了丰富且灵活的设计空间,同时实现了线性计算复杂度。然而,构建强大的视觉 TTT 设计仍具有挑战性:对于内部模块和内部训练的根本选择缺乏全面的理解和实用指南。为弥合这一关键差距,本文提出了一项系统实证研究,探讨视觉序列建模的 TTT 设计。通过一系列实验和分析,我们提炼出六项实用见解,确立有效视觉 TTT 的设计原则,并指明未来改进的路径。这些发现 culminate 在 Vision Test-Time Training(ViT) 模型中,该模型是一种纯 TTT 架构,实现了线性复杂度和可并行计算。我们在包括图像分类、图像生成、目标检测和语义分割等多种视觉任务上评估了 ViT。结果表明,ViT 在一致上匹配或超越了先进的线性复杂度模型(如 Mamba 和线性注意力变体),并有效缩小了与高度优化视觉 Transformer 的差距。我们希望本研究和 ViT 基线能够促进视觉 TTT 模型的未来工作。代码: github.com/LeapLabTHU/ViTTT。
关键词
引用
@article{arxiv.2512.01643,
title = {ViT$^3$: Unlocking Test-Time Training in Vision},
author = {Dongchen Han and Yining Li and Tianyu Li and Zixuan Cao and Ziming Wang and Jun Song and Yu Cheng and Bo Zheng and Gao Huang},
journal= {arXiv preprint arXiv:2512.01643},
year = {2026}
}
备注
CVPR 2026, oral