CoSIm:面向反事实场景想象的通识推理
计算与语言
2022-07-11 v1 人工智能
计算机视觉与模式识别
摘要
作为人类,我们可以通过在脑海中想象替代的物体或概念来修改对某一场景的假设。例如,我们可轻易预见到太阳被雨云遮蔽的后果(如街道会变湿)并据此做好准备。本文引入了一项称为面向反事实场景想象的通识推理(Commonsense Reasoning for Counterfactual Scene Imagination, CoSIm)的新任务/数据集,旨在评估 AI 系统对场景变化想象进行推理的能力。在该任务/数据集中,模型获得一幅图像及关于该图像的一个初始问答对。接着施加一个反事实想象场景变化(文本形式),模型须基于该场景变化预测初始问题的新回答。我们收集了 3.5K 高质量且具挑战性的数据实例,每个实例包含一幅图像、一个带回答的通识问题、一段反事实变化描述、该问题的新回答以及三个干扰回答。我们的数据集包含多种复杂场景变化类型(如物体添加/移除/状态改变、事件描述、环境变化等),要求模型想象多种不同情景并对变化后场景进行推理。我们给出了一个基于视觉-语言 Transformer(即 LXMERT)的基线模型及消融研究。通过人工评估,我们展示了巨大的人-模型性能差距,表明这一具挑战性的反事实场景想象任务尚有值得期待的未来工作空间。我们的代码与数据集公开于:https://github.com/hyounghk/CoSIm
引用
@article{arxiv.2207.03961,
title = {CoSIm: Commonsense Reasoning for Counterfactual Scene Imagination},
author = {Hyounghun Kim and Abhay Zala and Mohit Bansal},
journal= {arXiv preprint arXiv:2207.03961},
year = {2022}
}
备注
NAACL 2022 (13 pages)