中文

文本中未写之物:从视觉信号中探索空间常识

计算与语言 2022-04-28 v2 计算机视觉与模式识别

摘要

空间常识,即关于物体间空间位置与关系的知识(如狮子与女孩的相对大小,以及骑车时男孩相对于自行车的位置),是常识知识的重要组成部分。尽管预训练语言模型(PLMs)在许多NLP任务中表现出色,但已被证明在空间常识推理中效果不佳。从图像比文本更可能展现空间常识这一观察出发,我们探究具有视觉信号的模型是否比基于文本的PLM学到更多空间常识。我们提出一个聚焦于物体相对尺度、以及不同动作下人与物体间位置关系的空间常识基准。我们在该基准上探测了PLMs与具有视觉信号的模型(包括视觉-语言预训练模型与图像合成模型),发现图像合成模型比其他模型更擅长学习准确且一致的空间知识。图像合成模型中的空间知识也有助于需要空间常识的自然语言理解任务。

关键词

引用

@article{arxiv.2203.08075,
  title  = {Things not Written in Text: Exploring Spatial Commonsense from Visual Signals},
  author = {Xiao Liu and Da Yin and Yansong Feng and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2203.08075},
  year   = {2022}
}

备注

Accepted by ACL 2022 main conference