中文

Tempora:Characterizing Online Test-Time Adaptation 的时序效用

机器学习 2026-02-09 v1 计算机视觉与模式识别

摘要

Test-time adaptation (TTA) 为在域迁移下性能下降的机器学习(ML)模型提供了引人注目的解决方案,通过仅使用无标签样本即可在运行时提高泛化性。这种灵活性适用于实际部署,但常规评估不切实际地假设处理时间是无限的,忽略了准确性与延迟之间的权衡。随着机器学习越来越深入于延迟敏感和面向用户的应用场景,时间压力限制了可适应推理的可行性;迟到可以行动的预测是无效的。我们引入 Tempora,一个用于在此压力下评估 TTA 的框架。它包含建模部署约束的时序情景、操作化测量的评估协议以及量化准确性-延迟权衡的时间依赖效用指标。我们用三种此类指标实现该框架:(1)针对具有硬截止时间的异步流的离散效用;(2)针对价值随延迟衰减的交互式设置的连续效用;(3)针对受预算约束的部署的摊销效用。将 Tempora 应用于 ImageNet-C 上的七种 TTA 方法进行 240 次时序评估,揭示了排名不稳定:常规排名不预测在时序压力下的排名;在常规设置中处于领先地位的方法在 41.2% 的评估中表现不足。最高效用的方法因损坏类型和时序压力而异,没有明确的冠军。通过首次实现对多样化时序约束的系统评估,Tempora 揭示了排名逆转的时机和原因,为实践者提供方法选择的视角,也为研究人员提供可部署适应的目标。

关键词

引用

@article{arxiv.2602.06136,
  title  = {Tempora: Characterising the Time-Contingent Utility of Online Test-Time Adaptation},
  author = {Sudarshan Sreeram and Young D. Kwon and Cecilia Mascolo},
  journal= {arXiv preprint arXiv:2602.06136},
  year   = {2026}
}

备注

Preprint. Under review. Code available upon acceptance