中文

基于稀疏图学习与知识迁移的视觉对话推理

计算机视觉与模式识别 2021-09-01 v2 计算与语言 机器学习

摘要

视觉对话是一项利用先前对话历史作为上下文、基于图像回答一系列问题的任务。在本文中,我们研究如何解决该任务的两个基本挑战:(1) 在对话轮次之间的底层语义结构上进行推理;(2) 为给定问题识别多个合适的答案。为应对这些挑战,我们提出一种稀疏图学习(Sparse Graph Learning, SGL)方法,将视觉对话表述为图结构学习任务。SGL 通过引入二元边与分数边并利用一种新的结构损失函数,推断出固有的稀疏对话结构。接下来,我们引入一种知识迁移(Knowledge Transfer, KT)方法,从教师模型中提取答案预测并将其用作伪标签。我们提出 KT 以弥补单一真实标签的不足,后者严重限制了模型获得多个合理答案的能力。因此,与基线方法相比,我们提出的模型显著提升了推理能力,并在 VisDial v1.0 数据集上优于最先进的方法。源代码可在 https://github.com/gicheonkang/SGLKT-VisDial 获取。

关键词

引用

@article{arxiv.2004.06698,
  title  = {Reasoning Visual Dialog with Sparse Graph Learning and Knowledge Transfer},
  author = {Gi-Cheon Kang and Junseok Park and Hwaran Lee and Byoung-Tak Zhang and Jin-Hwa Kim},
  journal= {arXiv preprint arXiv:2004.06698},
  year   = {2021}
}

备注

EMNLP 2021 Findings