中文

大型视觉-语言模型中用于视频时序推理的时序对比学习

计算机视觉与模式识别 2024-12-17 v1

摘要

时序推理是视频-语言理解中的一项关键挑战,因为它要求模型在时间上保持语义概念的一致对齐。尽管现有的大型视觉-语言模型(LVLM)和大型语言模型(LLM)在静态任务中表现出色,但它们难以捕捉视频序列中的动态交互和时序依赖。在这项工作中,我们提出了通过动态提示进行时序语义对齐(TSADP),这是一个通过动态任务特定提示和时序对比学习来增强时序推理能力的新颖框架。TSADP利用动态提示生成器(DPG)编码细粒度的时序关系,并利用时序对比损失(TCL)在时间上对齐视觉和文本嵌入。我们在VidSitu数据集上评估了我们的方法,该数据集增加了丰富的时序标注,并在视频内实体关联、时序关系理解和时序预测等任务中展示了对最先进模型的显著改进。人工评估进一步证实了TSADP生成连贯且语义准确描述的能力。我们的分析突出了TSADP的鲁棒性、高效性和实用价值,使其成为视频-语言理解领域向前迈出的一步。

关键词

引用

@article{arxiv.2412.11391,
  title  = {Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models},
  author = {Rafael Souza and Jia-Hao Lim and Alexander Davis},
  journal= {arXiv preprint arXiv:2412.11391},
  year   = {2024}
}