中文

大型语言模型中的象似性

计算与语言 2025-10-17 v1 人工智能

摘要

词汇象似性,即词义与其形式之间的直接关系,是每种自然语言的重要特征,最常通过音义联想表现出来。由于大型语言模型(LLM)对文本意义和声音的获取仅是间接的(意义通过文本上下文获取,声音通过书面表征获取,且进一步被分词复杂化),我们可能会预期 LLM 中象似性的编码要么不充分,要么与人类处理方式存在显著差异。本研究通过让 GPT-4 在人工语言中生成高度象似的伪词来验证这一假设。为了验证这些词确实携带象似性,我们让捷克语和德语参与者(n=672)以及随后让基于 LLM 的参与者(由 GPT-4 和 Claude 3.5 Sonnet 生成)猜测其含义。结果显示,人类在猜测所生成的象似语言中的伪词含义时,其准确率高于猜测遥远自然语言中的词汇,而基于 LLM 的参与者在此任务中的表现甚至优于人类。这一核心发现还伴随着若干附加分析,涉及所生成语言的普遍性,以及人类和基于 LLM 的参与者所利用的线索。

关键词

引用

@article{arxiv.2501.05643,
  title  = {Iconicity in Large Language Models},
  author = {Anna Marklová and Jiří Milička and Leonid Ryvkin and Ľudmila Lacková Bennet and Libuše Kormaníková},
  journal= {arXiv preprint arXiv:2501.05643},
  year   = {2025}
}

备注

Supplementary information: https://osf.io/ywjrk/