基于稀疏图学习与知识迁移的视觉对话推理
计算机视觉与模式识别
2021-09-01 v2 计算与语言
机器学习
摘要
视觉对话是一项利用先前对话历史作为上下文、基于图像回答一系列问题的任务。在本文中,我们研究如何解决该任务的两个基本挑战:(1) 在对话轮次之间的底层语义结构上进行推理;(2) 为给定问题识别多个合适的答案。为应对这些挑战,我们提出一种稀疏图学习(Sparse Graph Learning, SGL)方法,将视觉对话表述为图结构学习任务。SGL 通过引入二元边与分数边并利用一种新的结构损失函数,推断出固有的稀疏对话结构。接下来,我们引入一种知识迁移(Knowledge Transfer, KT)方法,从教师模型中提取答案预测并将其用作伪标签。我们提出 KT 以弥补单一真实标签的不足,后者严重限制了模型获得多个合理答案的能力。因此,与基线方法相比,我们提出的模型显著提升了推理能力,并在 VisDial v1.0 数据集上优于最先进的方法。源代码可在 https://github.com/gicheonkang/SGLKT-VisDial 获取。
引用
@article{arxiv.2004.06698,
title = {Reasoning Visual Dialog with Sparse Graph Learning and Knowledge Transfer},
author = {Gi-Cheon Kang and Junseok Park and Hwaran Lee and Byoung-Tak Zhang and Jin-Hwa Kim},
journal= {arXiv preprint arXiv:2004.06698},
year = {2021}
}
备注
EMNLP 2021 Findings