中文

FunQA:面向令人惊讶的视频理解

计算机视觉与模式识别 2024-03-25 v2 人工智能 计算与语言 多媒体

摘要

令人惊讶的视频,如搞笑片段、创意表演或视觉错觉,吸引了大量关注。对这些视频的欣赏并非仅是对视觉刺激的反应,而是取决于人类理解(并欣赏)视频中所描绘的常识违背的能力。我们提出 FunQA,一个专门设计用于基于反直觉和有趣视频来评估并增强视频推理深度的具有挑战性的视频问答(QA)数据集。与大多数关注较少令人惊讶情境(如烹饪或教学视频)的视频 QA 基准不同,FunQA 涵盖三类此前未探索的令人惊讶视频:1)HumorQA,2)CreativeQA,和 3)MagicQA。对于每个子集,我们建立了严谨的 QA 任务,以评估模型在反直觉时间戳定位、细致视频描述以及围绕反直觉性的推理方面的能力。我们还提出更高层次的任务,如为视频赋予贴切且生动的标题,以及对视频创意进行打分。总体而言,FunQA 基准包含源自 4.3K 个视频片段的 312K 个自由文本 QA 对,总时长 24 小时视频。此外,我们提出 FunMentor,一种为视觉-语言模型(VLMs)设计的智能体,利用多轮对话增强模型对反直觉性的理解。基于现有 VLMs 的广泛实验证明了 FunMentor 的有效性,并揭示了 FunQA 视频在空间-时间推理、以视觉为中心的推理和自由文本生成方面的显著性能差距。

关键词

引用

@article{arxiv.2306.14899,
  title  = {FunQA: Towards Surprising Video Comprehension},
  author = {Binzhu Xie and Sicheng Zhang and Zitang Zhou and Bo Li and Yuanhan Zhang and Jack Hessel and Jingkang Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2306.14899},
  year   = {2024}
}

备注

Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA