通过对比学习改进视觉对话中的跨模态理解
计算机视觉与模式识别
2022-04-18 v1 计算与语言
摘要
视觉对话是一项具挑战性的视觉-语言任务,因为视觉对话智能体需要在对图像内容与对话历史进行推理后回答一系列问题。尽管现有方法试图处理视觉对话中的跨模态理解,但基于其对视觉与文本上下文的理解来对候选答案排序仍显不足。本文中,我们基于视觉-语言预训练模型 VD-BERT 分析视觉对话中的跨模态理解,并提出一种名为 ICMU 的新方法来改进视觉对话的跨模态理解。ICMU 通过基于四路对比学习区分不同的拉取输入(即拉取的图像、问题或答案)来增强跨模态理解。此外,ICMU 利用单轮视觉问答来增强视觉对话模型的跨模态理解,以处理多轮视觉接地对话。实验表明,所提方法改进了视觉对话模型的跨模态理解,并为 VisDial 数据集带来令人满意的增益。
引用
@article{arxiv.2204.07302,
title = {Improving Cross-Modal Understanding in Visual Dialog via Contrastive Learning},
author = {Feilong Chen and Xiuyi Chen and Shuang Xu and Bo Xu},
journal= {arXiv preprint arXiv:2204.07302},
year = {2022}
}
备注
ICASSP 2022