弱监督促进词-物对齐涌现并改进视觉-语言任务
计算机视觉与模式识别
2019-12-09 v1 计算与语言
机器学习
神经与进化计算
摘要
自注意力(即 transformer 模型)和类 BERT 训练原则的广泛采用,近期在大量视觉与语言问题(如视觉问答(VQA)、图像检索等)上催生了众多高性能模型。在本文中,我们指出这些当前最优(SOTA)方法在单模态内部信息结构化方面表现尚可,但尽管性能令人印象深刻,它们往往难以识别细粒度的模态间关系。事实上,此类关系频繁被假定为在训练期间由特定应用的损失(主要是分类用的交叉熵)隐式学习得到。虽然多数近期工作通过交叉注意力模块为模态间关系提供归纳偏置,但在本工作中,我们证明(1)后一假设不成立,即模态对齐未必自动涌现,以及(2)为视觉对象与词之间的对齐添加弱监督可提升在需要推理的任务上所学模型的质量。具体而言,我们将对象-词对齐损失整合进 SOTA 视觉-语言推理模型,并在 VQA 和语言驱动图像比较两项任务上评估。我们表明所提出的细粒度模态间监督显著提升了两项任务的性能。特别是,这一新学习信号使得在 GQA 数据集(VQA 任务)上用未经任务微调的预训练模型即取得 SOTA 水平性能,并在 NLVR2 数据集(语言驱动图像比较)上取得新 SOTA。最后,我们还通过可视化注意力分布说明了该贡献对模型推理的影响。
引用
@article{arxiv.1912.03063,
title = {Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks},
author = {Corentin Kervadec and Grigory Antipov and Moez Baccouche and Christian Wolf},
journal= {arXiv preprint arXiv:1912.03063},
year = {2019}
}