中文

ACQUIRED:一个用于回答真实生活视频中反事实问题的数据集

计算机视觉与模式识别 2023-11-06 v1 计算与语言

摘要

多模态反事实推理是人工智能系统一项重要却具挑战的能力。它涉及基于视觉与语言输入预测假设情境的结果,使AI模型能从失败中学习并探索假设场景。尽管重要,目前仅有少数数据集针对多模态模型的反事实推理能力。其中,它们仅覆盖合成环境或特定类型事件(如交通事故)上的推理,难以可靠地基准测试模型在多样真实场景与推理维度上的泛化能力。为克服这些局限,我们开发了一个视频问答数据集ACQUIRED:它包含3.9K标注视频,涵盖广泛事件类型并融合第一与第三人称视角,确保聚焦真实世界多样性。此外,每个视频标注了跨越物理、社会和时序三个不同推理维度的问题,可多方位全面评估模型反事实能力。我们将该数据集与若干最先进纯语言及多模态模型基准对比,实验结果表明模型与人类间存在显著性能差距(>13%)。研究结果表明多模态反事实推理仍是一个开放挑战,且ACQUIRED是一个全面可靠的基准,可启发该方向的未来研究。

关键词

引用

@article{arxiv.2311.01620,
  title  = {ACQUIRED: A Dataset for Answering Counterfactual Questions In Real-Life Videos},
  author = {Te-Lin Wu and Zi-Yi Dou and Qingyuan Hu and Yu Hou and Nischal Reddy Chandra and Marjorie Freedman and Ralph M. Weischedel and Nanyun Peng},
  journal= {arXiv preprint arXiv:2311.01620},
  year   = {2023}
}

备注

In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)