中文

CLEVR-Math:一个用于组合语言、视觉与数学推理的数据集

机器学习 2022-08-11 v1 计算与语言 计算机视觉与模式识别

摘要

我们提出 CLEVR-Math,一个多模态数学应用题数据集,由涉及加/减法的简单数学应用题组成,其部分由文本描述表示,部分由描绘场景的图像表示。文本描述了在图像所描绘场景上执行的动作。由于所提问题可能并非关于图像中的场景,而是关于动作施加前或施加后的场景状态,解题者需设想或想象这些动作引起的状态变化。解决这些应用题需要语言、视觉与数学推理的结合。我们将最先进的神经与神经符号模型应用于 CLEVR-Math 的视觉问答,并实证评估其性能。我们的结果表明,两种方法均无法泛化到操作链。我们讨论了二者在解决多模态应用题任务上的局限性。

关键词

引用

@article{arxiv.2208.05358,
  title  = {CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning},
  author = {Adam Dahlgren Lindström and Savitha Sam Abraham},
  journal= {arXiv preprint arXiv:2208.05358},
  year   = {2022}
}

备注

NeSy 2022, 16th International Workshop on Neural-Symbolic Learning and Reasoning, Cumberland Lodge, Windsor, UK