中文

幻觉缓解提示促进长视频理解

计算机视觉与模式识别 2024-06-18 v1

摘要

近年来,多模态大语言模型在视频理解任务上取得了显著进展。然而,它们理解未处理的长视频的能力非常有限,这主要是由于难以支持巨大的内存开销。尽管现有方法通过聚合帧在内存和信息之间取得了平衡,但它们不可避免地引入了严重的幻觉问题。为了解决这个问题,本文基于现有的多模态大语言模型构建了一个全面的幻觉缓解流程。具体来说,我们使用CLIP分数来指导带有问题的帧采样过程,选择与问题相关的关键帧。然后,我们将问题信息注入图像Q-Former的查询中,以获得更重要的视觉特征。最后,在答案生成阶段,我们利用思维链和上下文学习技术来显式控制答案的生成。值得一提的是,对于断点模式,我们发现图像理解模型比视频理解模型取得了更好的结果。因此,我们使用比较机制聚合了两种模型的答案。最终,我们在MovieChat数据集上分别取得了全局模式84.2%和断点模式62.9%的准确率,比官方基线模型分别高出29.1%和24.1%。此外,所提出的方法在CVPR LOVEU 2024长视频问答挑战赛中获得了第三名。代码可在https://github.com/lntzm/CVPR24Track-LongVideo获取。

关键词

引用

@article{arxiv.2406.11333,
  title  = {Hallucination Mitigation Prompts Long-term Video Understanding},
  author = {Yiwei Sun and Zhihang Liu and Chuanbin Liu and Bowei Pu and Zhihan Zhang and Hongtao Xie},
  journal= {arXiv preprint arXiv:2406.11333},
  year   = {2024}
}