中文

词汇覆盖得分:通过词汇覆盖度评估 LLM 中的词汇可达性

计算与语言 2026-05-27 v1 人工智能

摘要

现代大型语言模型(LLM)常因产生重复且同质化的文本而受到批评,尽管它们拥有庞大的潜在词汇表。虽然之前的研究聚焦于模型知识和训练数据,但我们探讨解码机制在抑制语言多样性中的作用。我们引入词汇覆盖得分(Word Coverage Score, WCS),衡量标准抽样过滤器(如 Top-pp、Top-kk 和 Min-pp)对上下文合适的人类词汇被数学性剪枝的程度。与评估静态知识不同,WCS 测量低频高信息人类词汇的生存率作为抽样参数的函数。通过在人类撰写的语料片段上审计开源模型,我们识别出哪些逻辑词汇选择在解码器中被渲染不可达,尽管它们位于概率空间内。我们的结果提供了行业标准抽样默认值作为意外审查机制的定量证据,将人类表达的独特纹理平滑为同质化话语。WCS 提供了一种优化文本连贯性与词汇丰富性之间权衡的严格框架,为在生成模型中保留人类语言多样性提供了诊断工具。

关键词

引用

@article{arxiv.2605.27268,
  title  = {Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)},
  author = {Samer Awad and Javier Conde and Carlos Arriaga and Tairan Fu and Javier Coronado-Blázquez and Pedro Reviriego},
  journal= {arXiv preprint arXiv:2605.27268},
  year   = {2026}
}

备注

15 pages, 6 figures