中文

大语言模型作为视频问答中的时间与因果推理器

计算机视觉与模式识别 2023-11-07 v2

摘要

大语言模型(LLMs)在广泛的自然语言理解与生成任务上展现了卓越性能。我们观察到,LLMs在视频问答(VideoQA)中利用语言捷径\textit{语言捷径}进行时间与因果推理时提供了有效先验。然而,此类先验常导致VideoQA的次优结果,因其使模型过度依赖问题,即语言偏差\textit{语言偏差},而忽略视觉内容。这也被称为“无依据猜测”或“幻觉”。为解决此问题同时利用LLMs在VideoQA上的先验,我们提出了一个新颖框架Flipped-VQA,鼓励模型通过翻转源对与目标标签来预测\langleV, Q, A\rangle三元组的所有组合以理解其复杂关系,即分别给定VQ、VA和QA对预测A、Q和V。本文中,我们将Flipped-VQA应用于LLaMA开发了LLaMA-VQA,其在五个具挑战性的VideoQA基准上优于基于LLM和非基于LLM的模型。此外,我们的Flipped-VQA是一个通用框架,适用于多种LLMs(OPT和GPT-J)并持续提升其性能。我们凭经验证明Flipped-VQA不仅增强了语言捷径的利用,还缓解了导致过度依赖问题而给出错误答案的语言偏差。代码见https://github.com/mlvlab/Flipped-VQA。

关键词

引用

@article{arxiv.2310.15747,
  title  = {Large Language Models are Temporal and Causal Reasoners for Video Question Answering},
  author = {Dohwan Ko and Ji Soo Lee and Wooyoung Kang and Byungseok Roh and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2310.15747},
  year   = {2023}
}

备注

Accepted paper at EMNLP 2023 Main