中文

所见即所得:对话中的视觉代词共指消解

计算与语言 2019-09-04 v1

摘要

将代词 grounding 到其所指称的视觉对象,需要从多种信息源进行复杂推理,尤其在对话场景中。例如,当对话中的人们在谈论所有说话者都能看到的事物时,他们常直接使用代词(如 it)来指代它,而无需事先引入。这一事实给现代自然语言理解系统带来了巨大挑战,尤其是传统的基于上下文的代词共指模型。为应对该挑战,本文正式定义了视觉感知的代词共指消解(PCR)任务,并引入大规模对话 PCR 数据集 VisPro,以探究视觉信息是否及如何帮助消解对话中的代词。我们随后提出一种新颖的视觉感知 PCR 模型 VisCoref,并在我们的数据集上进行了全面的实验与案例分析。结果证明了视觉信息在此 PCR 案例中的重要性,并展示了所提模型的有效性。

关键词

引用

@article{arxiv.1909.00421,
  title  = {What You See is What You Get: Visual Pronoun Coreference Resolution in Dialogues},
  author = {Xintong Yu and Hongming Zhang and Yangqiu Song and Yan Song and Changshui Zhang},
  journal= {arXiv preprint arXiv:1909.00421},
  year   = {2019}
}

备注

10 pages, 7 figures. Accepted by EMNLP 2019