超越语言:从图像中学习常识用于推理
计算与语言
2020-10-13 v1 人工智能
摘要
本文提出一种从图像中学习常识的新方法,而非依赖有限的原始文本或代价高昂的构建知识库,用于 NLP 中的常识推理问题。我们的动机源于一图胜千言,其中更丰富的场景信息可被利用以帮助提炼常隐藏于语言中的常识知识。我们的方法称为 Loire,包含两个阶段。第一阶段,利用双模态序列到序列方法基于文本表示模型 ViBERT 执行场景布局生成任务。如此,所需的视觉场景知识(如空间关系)将通过基于 COCO 等双模态数据的监督学习过程编码进 ViBERT。然后将 ViBERT 与预训练语言模型拼接以执行下游常识推理任务。在两个常识推理问题(即常识问答与代词消解)上的实验结果表明,Loire 优于传统的基于语言的方法。我们还给出一些案例研究,展示从图像中学到了什么知识,并解释生成的场景布局如何帮助常识推理过程。
引用
@article{arxiv.2010.05001,
title = {Beyond Language: Learning Commonsense from Images for Reasoning},
author = {Wanqing Cui and Yanyan Lan and Liang Pang and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2010.05001},
year = {2020}
}
备注
Accepted to EMNLP'20 Findings