StableTTA:通过无训练测试时适应方法提升视觉模型性能
计算机视觉与模式识别
2026-05-08 v3 人工智能
摘要
集成方法虽然能提高预测性能,但往往会带来高昂的内存和计算成本。我们发现,非线性投影和投票操作会导致聚合不稳定。为解决上述效率挑战和不一致性问题,本文提出了StableTTA——一种无训练测试时适应方法,包含两个变体。StableTTA-I针对一致性批量推理场景,适用于瞬时或语义上相邻观察结果可能属于同一类别的情形,如突发摄影、视频流、机器人感知和工业检测。在一致性批量推理下,StableTTA-I通过方差感知的logit聚合,显著提高了预测一致性和准确性。StableTTA-II通过特征级裁剪,实现单模型 backbone 单次前向传播即可完成logit聚合。在ImageNet-1K上进行的71个模型实验表明,StableTTA-I在一致性批量推理场景下持续提升预测准确率,而StableTTA-II则以最小的计算开销提供轻量且与模型架构无关的准确性提升。这些结果表明,推理时语义一致性和聚合稳定性为改进实际测试时适应系统提供了有益的视角。
引用
@article{arxiv.2604.04552,
title = {StableTTA: Improving Vision Model Performance by Training-free Test-Time Adaptation Methods},
author = {Zheng Li and Jerry Cheng and Huanying Helen Gu},
journal= {arXiv preprint arXiv:2604.04552},
year = {2026}
}
备注
27 pages, 10 figures, 9 tables