视频大语言模型在时间理解中的一致性研究
计算机视觉与模式识别
2025-03-18 v2
摘要
视频大语言模型能够将语言查询进行时间定位并检索视频时刻。然而,这种时间理解能力既没有得到充分研究,也没有被理解。因此,我们对预测一致性进行了研究——这是时间定位鲁棒性和可信度的关键指标。在模型识别出视频内容中的初始时刻后,我们应用一系列探针来检查模型的响应是否与该初始定位一致,以此作为可靠理解的指标。我们的结果表明,当前的 Video-LLM 对视频内容、语言查询和任务设置的变化很敏感,揭示了在保持一致性方面的严重缺陷。我们进一步探索了常见的提示和指令微调方法作为潜在解决方案,但发现它们的改进往往不稳定。为此,我们提出了显式考虑一致性的事件时间验证微调,并展示了在定位和一致性两方面的显著改进。我们的数据和代码已在 https://github.com/minjoong507/Consistency-of-Video-LLM 开源。
引用
@article{arxiv.2411.12951,
title = {On the Consistency of Video Large Language Models in Temporal Comprehension},
author = {Minjoon Jung and Junbin Xiao and Byoung-Tak Zhang and Angela Yao},
journal= {arXiv preprint arXiv:2411.12951},
year = {2025}
}
备注
Accepted to CVPR'25