CLEVR-Math:一个用于组合语言、视觉与数学推理的数据集
机器学习
2022-08-11 v1 计算与语言
计算机视觉与模式识别
摘要
我们提出 CLEVR-Math,一个多模态数学应用题数据集,由涉及加/减法的简单数学应用题组成,其部分由文本描述表示,部分由描绘场景的图像表示。文本描述了在图像所描绘场景上执行的动作。由于所提问题可能并非关于图像中的场景,而是关于动作施加前或施加后的场景状态,解题者需设想或想象这些动作引起的状态变化。解决这些应用题需要语言、视觉与数学推理的结合。我们将最先进的神经与神经符号模型应用于 CLEVR-Math 的视觉问答,并实证评估其性能。我们的结果表明,两种方法均无法泛化到操作链。我们讨论了二者在解决多模态应用题任务上的局限性。
引用
@article{arxiv.2208.05358,
title = {CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning},
author = {Adam Dahlgren Lindström and Savitha Sam Abraham},
journal= {arXiv preprint arXiv:2208.05358},
year = {2022}
}
备注
NeSy 2022, 16th International Workshop on Neural-Symbolic Learning and Reasoning, Cumberland Lodge, Windsor, UK