中文

大语言时代下的 VideoQA:实证研究

计算机视觉与模式识别 2025-06-17 v2 人工智能

摘要

视频大语言模型(Video-LLM)正迅猛发展,已推动许多视频语言任务的进展。作为金标准测试场,视频问答(VideoQA)在 Video-LLM 的开发中发挥着关键作用。本工作对 Video-LLM 在 VideoQA 中的行为进行了及时且全面的研究,旨在阐明其成功与失败模式,并为更贴近人类水平的视频理解和问答提供启示。我们的分析表明,Video-LLM 在 VideoQA 中表现出色;它们能够关联上下文线索,针对各种视频内容生成合理的回答。然而,这些模型在处理视频时间性方面存在困难,无论是对时间内容排序进行推理,还是对 grounding QA 相关的时间片段。此外,模型的行为并不直观——它们对对抗视频扰动不敏感,却对简单的候选答案和问题变体较为敏感。而且,它们并不一定能更好地泛化。这些发现表明 Video-LLM 在标准条件下具备一定的 QA 能力,但也凸显了其在鲁棒性和可解释性方面的严重不足,暗示在 Video-LLM 开发中迫切需要引入解释性机制。

关键词

引用

@article{arxiv.2408.04223,
  title  = {VideoQA in the Era of LLMs: An Empirical Study},
  author = {Junbin Xiao and Nanxin Huang and Hangyu Qin and Dongyang Li and Yicong Li and Fengbin Zhu and Zhulin Tao and Jianxing Yu and Liang Lin and Tat-Seng Chua and Angela Yao},
  journal= {arXiv preprint arXiv:2408.04223},
  year   = {2025}
}

备注

IJCV'25