语言模型是否将声音与意义关联起来?语音象征的多模态研究
计算与语言
2026-03-20 v6
摘要
语音象征是指语音形式与其意义之间非任意关联的语言概念。我们认为这可作为检验多模态大语言模型 (MLLM) 解释人类语言中听觉信息的有力探针。我们考察MLLM在语音象征上的表现,涵盖正字法 (orthographic) 与国际音标 (IPA) 文本形式及听觉形式输入,观察模型在最高多达25个语义维度 (如尖锐 vs. 圆润) 上的处理,并通过测量音素级注意力比例分数,衡量模型各层的信息处理。为此,我们构建LEX-ICON数据集,包含8,052个来自四种自然语言 (英语、法语、日语、韩语) 的词语及2,930个系统构造的拟词,标注了跨文本与听觉模态的语义特征。我们的主要发现表明:(1) MLLM的语音直觉在多个语义维度上与现有语言学研究一致;(2) 语音语义注意力模式揭示模型对象征性音素的关注。这些结果跨越人工智能与认知语言学领域,提供了首个大规模、定量分析MLLM语音象征性的解释性研究。
引用
@article{arxiv.2511.10045,
title = {Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism},
author = {Jinhong Jeong and Sunghyun Lee and Jaeyoung Lee and Seonah Han and Youngjae Yu},
journal= {arXiv preprint arXiv:2511.10045},
year = {2026}
}
备注
33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)