BERT 是盲的吗?探索视觉-语言预训练对视觉语言理解的影响
计算机视觉与模式识别
2023-11-07 v2 计算与语言
机器学习
摘要
大多数人类使用视觉想象来理解和推理语言,但诸如 BERT 之类的模型仅利用文本预训练期间获得的知识来推理语言。在这项工作中,我们研究视觉-语言预训练是否能提升涉及隐式视觉推理的纯文本任务上的性能,主要关注零样本探测方法。我们提出了一套用于探测文本编码器模型视觉推理能力的视觉语言理解(VLU)任务,以及用于比较的多种非视觉自然语言理解(NLU)任务。我们还贡献了一种新颖的零样本知识探测方法——Stroop 探测,用于将 CLIP 等模型应用于纯文本任务而无需诸如 BERT 类模型的掩码语言建模头之类的预测头。我们表明,最先进的多模态训练文本编码器在 VLU 任务上优于单模态训练文本编码器,而在 NLU 任务上却不及后者,这为先前关于多模态模型 NLU 能力的混杂结果提供了新的语境。我们得出结论:预训练期间对图像的接触赋予了内在的视觉推理知识,并体现在需要隐式视觉推理的纯语言任务中。我们的发现对多模态学习的更广阔背景具有重要意义,为此类语境中文本编码器的选择提供了原则性指导。
引用
@article{arxiv.2303.12513,
title = {Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining on Visual Language Understanding},
author = {Morris Alper and Michael Fiman and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2303.12513},
year = {2023}
}
备注
Accepted to CVPR 2023. Project webpage: https://isbertblind.github.io/