中文

用于语言与视觉推理的跨模态相关性

计算与语言 2020-05-14 v1

摘要

本工作致力于在语言与视觉数据上学习和推理的挑战,以服务于视觉问答(VQA)与自然语言视觉推理(NLVR)等相关下游任务。我们设计了一种新颖的跨模态相关性模块,该模块用于端到端框架中以在目标任务监督下学习各输入模态组件之间的相关性表示,相较于仅重塑原始表示空间,其对未观测数据更具泛化性。除建模文本实体与视觉实体之间的相关性外,我们还建模文本中实体关系与图像中对象关系之间的高阶相关性。我们提出的方法在两项不同的语言与视觉任务上使用公开基准展现出有竞争力的性能,并改进了已发表的最优(SOTA)结果。NLVR任务所学的输入空间对齐及其相关性表示提升了VQA任务的训练效率。

关键词

引用

@article{arxiv.2005.06035,
  title  = {Cross-Modality Relevance for Reasoning on Language and Vision},
  author = {Chen Zheng and Quan Guo and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2005.06035},
  year   = {2020}
}

备注

Accepted by ACL 2020