基于无监督任务发现的视觉问答迁移学习
机器学习
2019-04-09 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
我们研究如何利用现成的视觉与语言数据来应对视觉问答任务中的词汇表外答案问题。现有带标注的大规模视觉数据集(如图像类别标签、边界框和区域描述)是学习丰富多样视觉概念的良好来源。然而,由于依赖问题的回答模型与无问题的视觉数据之间缺乏联系,如何捕获这些视觉概念并将其迁移到视觉问答模型并不直观。我们分两步解决该问题:1)基于无监督任务发现,学习一个任务条件视觉分类器,能够解决多样的特定问题视觉识别任务;2)将该任务条件视觉分类器迁移到视觉问答模型中。具体而言,我们利用结构化词汇数据库(如 WordNet)和视觉描述等语言知识源进行无监督任务发现,并将学到的任务条件视觉分类器作为视觉问答模型中的回答单元进行迁移。我们通过实验表明,所提算法利用从视觉数据集迁移的知识,能够成功泛化到词汇表外答案。
引用
@article{arxiv.1810.02358,
title = {Transfer Learning via Unsupervised Task Discovery for Visual Question Answering},
author = {Hyeonwoo Noh and Taehoon Kim and Jonghwan Mun and Bohyung Han},
journal= {arXiv preprint arXiv:1810.02358},
year = {2019}
}
备注
CVPR 2019