中文

应对以图元为中心视频中缺失模态性的测试时适应

计算机视觉与模式识别 2025-03-04 v2

摘要

理解包含多种模态的视频至关重要,尤其是以图元为中心的视频,结合各种感知输入可显著提高动作识别和时刻局化等任务。然而,现实应用常面临模态不完整的挑战,可能由于隐私 concerns、效率需求或硬件问题。当前方法虽然有效,但通常需要完全重新训练模型才能处理缺失的模态,尤其在大型训练数据集上会变得计算密集。本研究提出了一种新方法,在测试时解决此问题,而无需重新训练。我们将问题定义为测试时适应任务,模型在测试时针对可用的无标签数据进行调整。我们的方法,MiDl(Mutual information with self-Distillation),鼓励模型对测试时可用的特定模态来源不敏感,通过最小化预测与可用模态之间的相互信息来实现。此外,我们采用自蒸馏以维持当两种模态都可用时模型的原始性能。MiDl代表了处理测试时缺失模态的首个自监督、在线解决方案,仅在测试时处理。通过针对各种预训练模型和数据集进行实验,MiDl在无需重新训练的情况下显著提高了性能。

关键词

引用

@article{arxiv.2404.15161,
  title  = {Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos},
  author = {Merey Ramazanova and Alejandro Pardo and Bernard Ghanem and Motasem Alfarra},
  journal= {arXiv preprint arXiv:2404.15161},
  year   = {2025}
}