学习为视觉对话定位视觉对象
计算机视觉与模式识别
2022-06-01 v3 计算与语言
摘要
视觉对话具有挑战性,因为它需要基于对环境图像的理解来回答一系列连贯的问题。如何定位相关的视觉对象是关键问题之一。先前的研究利用问题和历史来关注图像并取得了令人满意的性能,然而这些方法在没有引导的情况下不足以定位相关视觉对象。不恰当的视觉对象定位阻碍了视觉对话模型的性能。本文中,我们提出一种新颖的方法,为视觉对话学习定位(Learn to Ground)视觉对象,其采用一种新颖的视觉对象定位机制,其中利用视觉对象上的先验分布与后验分布来促进视觉对象定位。具体而言,视觉对象的后验分布由上下文(历史和问题)与答案共同推断,并确保训练过程中视觉对象的恰当定位。同时,仅由上下文推断的先验分布被用于逼近后验分布,从而即使在推理过程无答案时也能恰当定位视觉对象。在 VisDial v0.9 和 v1.0 数据集上的实验结果表明,我们的方法在生成式和判别式设定下均以显著幅度改进了此前的强模型。
引用
@article{arxiv.2109.06013,
title = {Learning to Ground Visual Objects for Visual Dialog},
author = {Feilong Chen and Xiuyi Chen and Can Xu and Daxin Jiang},
journal= {arXiv preprint arXiv:2109.06013},
year = {2022}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2021