幕后:揭示预训练视觉-语言模型的秘密
计算机视觉与模式识别
2020-07-21 v2 计算与语言
摘要
近期基于Transformer的大规模预训练模型革新了视觉-语言(V+L)研究。诸如ViLBERT、LXMERT和UNITER等模型通过联合图像-文本预训练,在广泛的V+L基准上显著提升了最先进水平。然而,导致其惊人成功的内在机制却鲜为人知。为揭示这些强大模型幕后的秘密,我们提出VALUE(视觉-语言理解评测),一套精心设计的、可泛化至标准预训练V+L模型的探测任务(如视觉共指消解、视觉关系检测、语言探测任务),旨在解读多模态预训练的内部运作(如各注意力头中隐含获取的知识、通过上下文多模态嵌入学习到的固有跨模态对齐)。通过这些探测任务对每个典型模型架构的广泛分析,我们的关键观察为:(i)预训练模型在推理时倾向于关注文本而非图像。(ii)存在一组专门用于捕捉跨模态交互的注意力头。(iii)预训练模型中学习到的注意力矩阵展现出与图像区域和文本词之间潜在对齐一致的模式。(iv)绘制的注意力图揭示了图像区域间视觉可解释的关系。(v)纯语言知识也有效编码于注意力头中。这些宝贵见解可指导未来工作设计更好的多模态预训练模型架构与目标。
引用
@article{arxiv.2005.07310,
title = {Behind the Scene: Revealing the Secrets of Pre-trained Vision-and-Language Models},
author = {Jize Cao and Zhe Gan and Yu Cheng and Licheng Yu and Yen-Chun Chen and Jingjing Liu},
journal= {arXiv preprint arXiv:2005.07310},
year = {2020}
}
备注
Accepted by ECCV 2020 as Spotlight