大型语言模型中的象似性
计算与语言
2025-10-17 v1 人工智能
摘要
词汇象似性,即词义与其形式之间的直接关系,是每种自然语言的重要特征,最常通过音义联想表现出来。由于大型语言模型(LLM)对文本意义和声音的获取仅是间接的(意义通过文本上下文获取,声音通过书面表征获取,且进一步被分词复杂化),我们可能会预期 LLM 中象似性的编码要么不充分,要么与人类处理方式存在显著差异。本研究通过让 GPT-4 在人工语言中生成高度象似的伪词来验证这一假设。为了验证这些词确实携带象似性,我们让捷克语和德语参与者(n=672)以及随后让基于 LLM 的参与者(由 GPT-4 和 Claude 3.5 Sonnet 生成)猜测其含义。结果显示,人类在猜测所生成的象似语言中的伪词含义时,其准确率高于猜测遥远自然语言中的词汇,而基于 LLM 的参与者在此任务中的表现甚至优于人类。这一核心发现还伴随着若干附加分析,涉及所生成语言的普遍性,以及人类和基于 LLM 的参与者所利用的线索。
引用
@article{arxiv.2501.05643,
title = {Iconicity in Large Language Models},
author = {Anna Marklová and Jiří Milička and Leonid Ryvkin and Ľudmila Lacková Bennet and Libuše Kormaníková},
journal= {arXiv preprint arXiv:2501.05643},
year = {2025}
}
备注
Supplementary information: https://osf.io/ywjrk/