CausalChaos!:基于动态视觉场景中更长因果链的全面因果动作问答数据集
计算机视觉与模式识别
2024-06-17 v2 人工智能
计算与语言
机器学习
摘要
因果视频问答(QA)日益受到关注,但现有数据集在因果推理方面往往缺乏深度。为弥补这一差距,我们利用卡通的独特属性构建了CausalChaos!,一个新颖、具有挑战性的因果Why-QA数据集,基于标志性的《猫和老鼠》卡通系列。卡通运用动画原理,允许动画师在事件之间创建表达清晰、无歧义的因果关系,以形成连贯的故事情节。利用这些属性,结合发人深省的问题和多层次答案(答案和详细的因果解释),我们的问题涉及连接角色与视觉场景之间多个动态交互的因果链。这些因素要求模型解决更具挑战性但定义明确的因果关系。我们还引入了困难错误答案挖掘,包括一个更具挑战性的因果混淆版本。虽然模型表现良好,但仍有很大的改进空间,尤其是在开放式答案上。我们确定更高级/显式的因果关系建模以及视觉与语言的联合建模是未来工作应重点关注的直接领域。连同其他互补数据集,我们新的挑战性数据集将为这些领域的发展铺平道路。
引用
@article{arxiv.2404.01299,
title = {CausalChaos! Dataset for Comprehensive Causal Action Question Answering Over Longer Causal Chains Grounded in Dynamic Visual Scenes},
author = {Paritosh Parmar and Eric Peh and Ruirui Chen and Ting En Lam and Yuhan Chen and Elston Tan and Basura Fernando},
journal= {arXiv preprint arXiv:2404.01299},
year = {2024}
}
备注
Project Page: https://github.com/LUNAProject22/CausalChaos