中文

Vista-LLaMA: 通过与视觉 Token 等距减少视频语言模型中的幻觉

计算机视觉与模式识别 2025-03-04 v2

摘要

大型视频语言模型的最新进展在视频理解中展现出可喜的成果。现有方法直接将视频转换为语言 token,并利用大型语言模型处理多模态任务。然而,随着文本长度的增加和视频影响的减弱,该方法常导致生成无关内容,即通常所称的“幻觉”。为解决此问题,我们提出 Vista-LLaMA,一种新颖的框架,能在任意语言 token 与所有视觉 token 之间保持一致的距离,而不受生成文本长度的影响。Vista-LLaMA 在确定视觉与文本 token 之间的注意力权重时省略了相对位置编码,同时保留了文本与文本 token 之间的位置编码。这放大了视觉 token 对文本生成的影响,尤其是当视觉与文本 token 之间的相对距离较大时。所提出的注意力机制显著降低了生成与视频内容无关文本的概率。此外,我们提出了一个序列视觉投影器,借助前一帧将当前视频帧投影到语言空间的 token。该方法不仅捕捉了视频内的时间关系,还允许用更少的视觉 token 涵盖整个视频。我们的方法在四个具有挑战性的开放式视频问答基准上显著优于多种先前方法(如 Video-ChatGPT、MovieChat)。我们在零样本 NExT-QA 上达到 60.7 的准确率,在零样本 MSRVTT-QA 上达到 60.5,创造了新的 SOTA 性能。项目页面:https://jinxxian.github.io/Vista-LLaMA。

关键词

引用

@article{arxiv.2312.08870,
  title  = {Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens},
  author = {Fan Ma and Xiaojie Jin and Heng Wang and Yuchen Xian and Jiashi Feng and Yi Yang},
  journal= {arXiv preprint arXiv:2312.08870},
  year   = {2025}
}