12合1:视觉与语言多任务表示学习
计算机视觉与模式识别
2020-04-28 v2 计算与语言
机器学习
摘要
视觉与语言研究大多聚焦于一小部分但多样化的独立任务及常孤立研究的支撑数据集;然而,这些任务所需的视觉接地语言理解技能高度重叠。本工作中,我们通过对大规模多任务训练机制的研究来探究这些视觉与语言任务间的关系。我们的方法最终在来自四类广泛任务的 12 个数据集上得到单一模型,包括视觉问答、基于描述的图文检索、指代表达式定位以及多模态验证。相较于独立训练的单任务模型,这相当于将约 30 亿参数缩减至 2.7 亿,同时在各任务上平均提升 2.05 个点。我们利用多任务框架深入分析了联合训练多样化任务的影响。进一步,我们展示从我们的单一多任务模型微调特定任务模型可带来进一步提升,达到或超越当前最优性能。
引用
@article{arxiv.1912.02315,
title = {12-in-1: Multi-Task Vision and Language Representation Learning},
author = {Jiasen Lu and Vedanuj Goswami and Marcus Rohrbach and Devi Parikh and Stefan Lee},
journal= {arXiv preprint arXiv:1912.02315},
year = {2020}
}
备注
Jiasen Lu and Vedanuj Goswami contributed equally to this work