视觉与语言预训练能否改善词汇接地?
计算与语言
2021-09-22 v1 人工智能
计算机视觉与模式识别
摘要
仅从文本导出的语言表示一直因缺乏接地(即将词语与其在物理世界中的意义相连接)而受到批评。联合在文本与图像或视频数据上训练的视觉与语言(VL)模型,已被作为对此类批评的一种回应。然而,尽管 VL 预训练在视觉问答等多模态任务上已展现出成功,其内部语言表示本身与仅文本对应表示相比如何尚属未知。本文在仅语言设定下,使用一套分析(聚类、探测以及在一个常识问答任务上的表现)比较了两种近期 VL 模型经 VL 与仅文本预训练所学到的语义表示。我们发现多模态模型未能显著优于仅文本变体,这表明若要将多模态预训练作为改善通用 NLP 的手段,尚需未来工作。
引用
@article{arxiv.2109.10246,
title = {Does Vision-and-Language Pretraining Improve Lexical Grounding?},
author = {Tian Yun and Chen Sun and Ellie Pavlick},
journal= {arXiv preprint arXiv:2109.10246},
year = {2021}
}
备注
Camera ready for Findings of EMNLP 2021