中文

衡量 LLM 新颖性:原创高质量输出的前沿

计算与语言 2025-10-08 v2

摘要

随着大语言模型(LLMs)在构思和科学发现中日益受到重视,对其生成新颖输出的能力进行评估变得至关重要。先前的工作将新颖性评估为对模型训练数据中原创性,但原创输出可能质量较低。相比之下,非专家评判者对质量评分更可靠,但可能偏好记忆输出,限制了人类偏好作为指标的可靠性。我们引入一种新的 LLM 生成文本的新颖性度量标准,该标准在原创性和质量之间取得平衡——即训练期未见 n-gram 比例与任务特定质量评分的调和平均数。使用这一框架,我们识别了来自三个开放数据模型家族(OLMo、OLMo-2 和 Pythia)在三个创意任务上的生成趋势:故事续写、诗歌创作和创意工具使用。我们发现,来自某些基础 LLM 的模型生成文本在原创性方面不如互联网上的人类编写文本。然而,增加模型规模和后训练可靠地提高新颖性,因为质量的提升。我们也发现,提高同一规模下的基础模型(例如从 OLMo 7B 提升到 OLMo-2 7B)会导致更高的新颖性,因为原创性更高。最后,我们观察到推理时间方法(如提示和提供新颖的情境示例)对新颖性的影响较小,往往会以牺牲质量为代价来增加原创性。这凸显了在用于创意应用时,进一步研究更有效的诱发策略的必要性。

关键词

引用

@article{arxiv.2504.09389,
  title  = {Measuring LLM Novelty As The Frontier Of Original And High-Quality Output},
  author = {Vishakh Padmakumar and Chen Yueh-Han and Jane Pan and Valerie Chen and He He},
  journal= {arXiv preprint arXiv:2504.09389},
  year   = {2025}
}

备注

Updated results with higher coverage of open-data models and better quality judgments