基于多模态域适应的开放式视觉问答
计算机视觉与模式识别
2019-11-12 v1
摘要
我们研究利用有监督域适应解决图像中的视觉问答(VQA)问题,其中源域有大量标注数据而目标域仅有少量标注数据,目标是训练出良好的目标模型。一种直接的方案是用这些有限的目标域标注数据微调预训练的源模型,但由于源域与目标域数据分布之间存在显著差异,该方法通常表现不佳。此外,VQA 中多模态(即图像、问题和答案)的可用性给建模这些不同模态间的可迁移性带来了进一步挑战。本文中,我们通过提出一种新颖的用于 VQA 的有监督多模态域适应方法来解决上述问题,以跨域跨模态学习联合特征嵌入。具体而言,我们通过将所有模态作为一个整体以及分别针对各个单独模态来考虑,对齐源域和目标域的数据分布。基于在基准 VQA 2.0 和 VizWiz 数据集上针对现实开放式 VQA 任务的大量实验,我们证明了所提方法在这一具有挑战性的 VQA 域适应设定下优于现有的 state-of-the-art 方法。
引用
@article{arxiv.1911.04058,
title = {Open-Ended Visual Question Answering by Multi-Modal Domain Adaptation},
author = {Yiming Xu and Lin Chen and Zhongwei Cheng and Lixin Duan and Jiebo Luo},
journal= {arXiv preprint arXiv:1911.04058},
year = {2019}
}