中文

跨视频场景的时间视频定位多模态域自适应

计算机视觉与模式识别 2023-12-22 v1

摘要

时间视频定位(TVG)旨在根据给定的语言查询,在未剪辑的视频中定位特定片段的时间边界。由于该领域的数据集通常是从有限的视频场景中收集的,模型倾向于过拟合特定场景的因素,导致在现实应用中遇到新场景时性能不佳。在新场景中,由于昂贵的人工成本,细粒度标注往往不足,而粗粒度的视频 - 查询对则更容易获得。因此,为了解决这个问题并提高模型在新场景上的性能,我们首次探索了在跨场景的无监督域自适应(UDA)设置下的 TVG 任务,其中源场景(域)中的视频 - 查询对标注有时间边界,而目标场景中的则没有。在 UDA 设置下,我们引入了一种新的对抗性多模态域自适应(AMDA)方法,通过结合来自目标数据的见解来自适应地调整模型的场景相关知识。具体而言,我们利用域判别器来解决域差距,这有助于识别在两个域中都有效的有价值的场景相关特征。同时,我们通过对齐具有相关语义的视频 - 查询对来减轻不同模态之间的语义差距。此外,我们采用掩码重建方法来增强对场景内时间语义的理解。在 Charades-STA、ActivityNet Captions 和 YouCook2 上的大量实验证明了我们提出方法的有效性。

关键词

引用

@article{arxiv.2312.13633,
  title  = {Multi-Modal Domain Adaptation Across Video Scenes for Temporal Video Grounding},
  author = {Haifeng Huang and Yang Zhao and Zehan Wang and Yan Xia and Zhou Zhao},
  journal= {arXiv preprint arXiv:2312.13633},
  year   = {2023}
}