中文

ARGUS:面向视频大语言模型的幻觉与遗漏评估

计算机视觉与模式识别 2025-06-11 v2

摘要

视频大语言模型尚未得到广泛部署,主要是由于其倾向于产生幻觉信息。目前的视频-LLM基准测试仅依赖多选题,然而视频LLM在自由文本生成任务(如视频描述生成)中会比在多选题验证任务中更积极地产生幻觉。为此,我们提出ARGUS,一个衡量自由形式视频描述性能的基准测试。通过将视频LLM的输出与人类基准描述进行比较,ARGUS量化了双重指标:首先,衡量以错误陈述或时间关系不正确形式出现的幻觉率;其次,衡量模型遗漏重要描述细节的速率。这些双重指标构成了对视频描述性能的全面视图。

关键词

引用

@article{arxiv.2506.07371,
  title  = {ARGUS: Hallucination and Omission Evaluation in Video-LLMs},
  author = {Ruchit Rawal and Reza Shirkavand and Heng Huang and Gowthami Somepalli and Tom Goldstein},
  journal= {arXiv preprint arXiv:2506.07371},
  year   = {2025}
}

备注

Project page with all the artifacts: https://ruchitrawal.github.io/argus