中文

人类语言模型中的词汇多样性

计算与语言 2026-01-27 v2

摘要

尽管对大型语言模型(LLM)生成文本是否真正符合人类水平这一问题已引起广泛关注,但仍不清楚其在词汇多样性方面的表现。本研究从词汇多样性角度切入,具体探讨了四个 ChatGPT 模型(ChatGPT-3.5、ChatGPT-4、ChatGPT-o4 mini 和 ChatGPT-4.5)生成文本中词汇多样性模式,以及由 L1 和 L2 英语参与者(n = 240)在四个教育水平下所写文本的词汇多样性。对每段文本测量了六个词汇多样性维度:体积、丰度、种类-重复、均匀性、差异度和离散度。结果通过单因素 MANOVAs、单因素 ANOVAs 和支持向量机显示,ChatGPT 生成的文本在每个变量上都与人类撰写的文本存在显著差异,其中 ChatGPT-o4 mini 和 ChatGPT-4.5 差异最大。就这两个组而言,ChatGPT-4.5 虽然生成的 token 更少,但展现出更高的词汇多样性水平。人类撰写者的词汇多样性在子组(即教育水平、语言状态)之间没有差异。总体而言,结果表明 ChatGPT 模型在词汇多样性方面不符合人类文本特征,较新的模型比旧模型生成的文本更不像人类。我们讨论了这些结果对语言教学及相关应用的影响。

关键词

引用

@article{arxiv.2508.00086,
  title  = {Do LLMs produce texts with "human-like" lexical diversity?},
  author = {Kelly Kendro and Jeffrey Maloney and Scott Jarvis},
  journal= {arXiv preprint arXiv:2508.00086},
  year   = {2026}
}