中文

TTA-Vid:视频推理的通用测试时适应

计算机视觉与模式识别 2026-04-02 v1

摘要

最近的视频推理模型在时序和多模态理解方面取得了强劲结果,但它们依赖大规模监督数据和多阶段训练流水线,导致训练成本高且难以适应新领域。在本工作中,我们利用视频-语言数据上的测试时强化学习范式,使预训练模型能够在测试时无需显式标签即可适应新到达的视频样本。提出的测试时视频适应方法 (TTA-Vid) 结合了两个同时工作的组件:(1) 一种测试时适应,在推理时对多个帧子集进行逐步推理。然后我们使用跨不同帧子集计算的基于频率的批量感知奖励作为伪真实标签来更新模型。结果表明,在单个批次甚至单个样本上训练的模型,能够在测试时泛化到整个数据集甚至跨数据集。由于适应完全发生在测试时,我们的方法无需真实标注或专用训练划分。此外,我们提出了一种多臂赌博机策略用于自适应帧选择,通过相同的奖励公式引导模型优先选择信息量丰富的帧。我们的评估表明,TTA-Vid 在各种视频推理任务上持续改进,并且能够超越当前基于大规模数据训练的最先进方法。这突显了测试时强化学习在时序多模态理解中的潜力。

关键词

引用

@article{arxiv.2604.00696,
  title  = {TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning},
  author = {Soumya Shamarao Jahagirdar and Edson Araujo and Anna Kukleva and M. Jehanzeb Mirza and Saurabhchand Bhati and Samuel Thomas and Brian Kingsbury and Rogerio Feris and James R. Glass and Hilde Kuehne},
  journal= {arXiv preprint arXiv:2604.00696},
  year   = {2026}
}