大语言模型词汇在温度变化下的建模:语言因素、多样性与典型性
计算与语言
2026-03-20 v1
摘要
大语言模型(LLMs)在文本生成方面取得了惊人的成绩,但其语言知识的本质——特别是其内部词汇的人类化程度——仍然存在疑问。本研究比较了人类和大语言模型生成的词汇联想,以评估模型是否准确捕捉人类词汇模式。我们使用来自SWOW数据集的英文提示-响应对,并通过多种温度设置获取来自三个大语言模型(Mistral-7B、Llama-3.1-8B和Qwen-2.5-32B)的新生成联想,检验(i)词汇因素如词频和具体性对提示-响应对的影响,以及(ii)大语言模型响应的可变性和典型性与人类响应的差异。结果表明,所有模型都反映出人类关于词频和具体性的趋势,但在响应可变性和典型性方面存在差异。较大的模型如Qwen倾向于模仿单个“原型”人类参与者,生成高度典型但最小可变的响应,而较小的模型如Mistral和Llama则产生更具可变性但不够典型的响应。温度设置进一步影响了这种权衡,更高的值增加可变性但降低典型性。这些发现突显了人类和大语言模型词汇之间的相似性和差异性,强调在探测大语言模型词汇表示时需要考虑模型规模和温度。
引用
@article{arxiv.2603.18171,
title = {Modeling the human lexicon under temperature variations: linguistic factors, diversity and typicality in LLM word associations},
author = {Maria Andueza Rodriguez and Marie Candito and Richard Huyghe},
journal= {arXiv preprint arXiv:2603.18171},
year = {2026}
}
备注
11 pages, 12 figures, to appear in LREC 2026