对齐的图像-词表示改善跨视觉-语言任务的归纳迁移
计算机视觉与模式识别
2017-10-17 v2 人工智能
机器学习
神经与进化计算
机器学习
摘要
计算机视觉的一个重要目标是构建能够随时间学习可应用于许多任务的视觉表示的系统。在本文中,我们研究了一种作为核心表示的视觉-语言嵌入,并表明其比标准的多任务学习带来更好的跨任务迁移。具体而言,通过强制视觉识别任务与视觉问答任务使用相同的词-区域嵌入,将两者对齐。我们表明,这导致了比标准多任务学习更大的从识别到 VQA 的归纳迁移。视觉识别也得到了改善,特别是对于那些具有相对较少识别训练标签但在 VQA 设置中频繁出现的类别。因此,我们的论文通过展示可解释、灵活且可训练的核心表示的好处,朝着创建更通用的视觉系统迈出了小小一步。
引用
@article{arxiv.1704.00260,
title = {Aligned Image-Word Representations Improve Inductive Transfer Across Vision-Language Tasks},
author = {Tanmay Gupta and Kevin Shih and Saurabh Singh and Derek Hoiem},
journal= {arXiv preprint arXiv:1704.00260},
year = {2017}
}
备注
Accepted in ICCV 2017. The arxiv version has an extra analysis on correlation with human attention