通过感知强度评级探索大型语言模型的多模态感知
计算与语言
2025-11-10 v2
摘要
本研究通过检验多模态大语言模型跨感官模态捕捉感知强度评级的能力,探讨了它们能否实现类人的感官基础。我们探索了模型特征(规模、多模态能力、架构生成)如何影响基础性能、分布因素依赖(词频、嵌入、特征距离)以及人机处理差异。我们通过相关性、距离度量和定性分析,使用 Lancaster 感知运动规范中的 3,611 个词,对来自四个系列(GPT、Gemini、LLaMA、Qwen)的 21 个模型进行了评估。结果表明,较大的(8 次比较中有 6 次)、多模态的(7 次中有 5 次)和较新的(8 次中有 5 次)模型通常优于较小的、纯文本的和较旧的模型。顶级模型达到了 85-90% 的准确率,与人类评级的相关性达到 0.58-0.65,表现出显著的相似性。此外,分布因素影响极小,未超过人类的依赖水平。然而,尽管存在很强的一致性,模型并不完全等同于人类,因为即使是表现最好的模型在距离和相关度指标上也表现出差异,定性分析揭示了与缺失感官基础相关的处理模式。此外,引入多模态是否能解决这种基础缺失仍存疑问。尽管多模态提高了性能,但它似乎提供了与海量文本相似的信息,而非本质上不同的数据,因为其收益体现在不相关的感官维度上,且庞大的纯文本模型也取得了可比的结果。我们的研究结果表明,尽管先进的 LLM 可以通过统计学习近似人类的感官-语言关联,但在处理机制上仍与人类的具身认知不同,即使进行了多模态整合也是如此。
引用
@article{arxiv.2503.06980,
title = {Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings},
author = {Jonghyun Lee and Dojun Park and Jiwoo Lee and Hoekeon Choi and Sung-Eun Lee},
journal= {arXiv preprint arXiv:2503.06980},
year = {2025}
}
备注
Published in IEEE Access