重新审视大参数时代的多模态分布式语义
计算与语言
2025-06-05 v1 计算机视觉与模式识别
摘要
人类的学习和概念表示是建立在感官运动经验基础上的,这与当前主流模型形成鲜明对比。在本文中,我们研究了大规模模型(训练于海量数据)在表示具体物体概念语义特征 norms 方面的能力,例如玫瑰是红色的、香甜的、且是一种花。更具体地说,我们使用探针任务来测试这些模型是否了解这些物体的哪些属性。我们评估了仅训练于图像数据的图像编码器,以及多模态训练的图像编码器和仅语言的模型,对预测扩展版经典 McRae 规范以及较新的 Binder 数据集中的属性评级。我们发现,多模态图像编码器略胜于仅语言的方法,而仅图像的编码器在非视觉属性(被分类为“百科全书式”或“功能”)上也表现相当,甚至与语言模型相当。这些结果为从纯单模态学习中能获得什么提供了新的见解以及模态之间的互补性。
引用
@article{arxiv.2506.03994,
title = {Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era},
author = {Dan Oneata and Desmond Elliott and Stella Frank},
journal= {arXiv preprint arXiv:2506.03994},
year = {2025}
}
备注
ACL Findings 2025