中文

视频大语言模型在时间理解中的一致性研究

计算机视觉与模式识别 2025-03-18 v2

摘要

视频大语言模型能够将语言查询进行时间定位并检索视频时刻。然而,这种时间理解能力既没有得到充分研究,也没有被理解。因此,我们对预测一致性进行了研究——这是时间定位鲁棒性和可信度的关键指标。在模型识别出视频内容中的初始时刻后,我们应用一系列探针来检查模型的响应是否与该初始定位一致,以此作为可靠理解的指标。我们的结果表明,当前的 Video-LLM 对视频内容、语言查询和任务设置的变化很敏感,揭示了在保持一致性方面的严重缺陷。我们进一步探索了常见的提示和指令微调方法作为潜在解决方案,但发现它们的改进往往不稳定。为此,我们提出了显式考虑一致性的事件时间验证微调,并展示了在定位和一致性两方面的显著改进。我们的数据和代码已在 https://github.com/minjoong507/Consistency-of-Video-LLM 开源。

关键词

引用

@article{arxiv.2411.12951,
  title  = {On the Consistency of Video Large Language Models in Temporal Comprehension},
  author = {Minjoon Jung and Junbin Xiao and Byoung-Tak Zhang and Angela Yao},
  journal= {arXiv preprint arXiv:2411.12951},
  year   = {2025}
}

备注

Accepted to CVPR'25