视觉与语言训练有助于部署分类知识但并未从根本上改变它
计算与语言
2025-10-31 v2 人工智能
摘要
视觉与语言(VL)训练是否会以有意义的方式改变语言模型的 linguistic representations?文献中的大多数结果在行为和表征层面都显示出不一致或微小的差异。在这项工作中,我们从以下假设出发:VL 训练可能产生显著影响的领域是词汇-概念知识,特别是其分类组织。通过比较纯文本语言模型及其经过 VL 训练的对应模型的最小对比对,我们首先表明,在需要理解问题中提及的概念的分类知识的纯文本问答任务上,VL 模型通常优于其纯文本对应模型。通过一系列有针对性的行为和表征分析,我们表明语言模型和视觉语言模型在分类知识本身方面没有显著差异,但它们在表示包含分类关系概念与不包含分类关系概念的问题方面存在差异。这意味着分类知识本身并未通过额外的 VL 训练发生实质性改变,但 VL 训练确实改善了在特定任务背景下部署这种知识的能力,即使该任务的呈现形式是纯语言的。
引用
@article{arxiv.2507.13328,
title = {Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It},
author = {Yulu Qin and Dheeraj Varghese and Adam Dahlgren Lindström and Lucia Donatelli and Kanishka Misra and Najoung Kim},
journal= {arXiv preprint arXiv:2507.13328},
year = {2025}
}