中文

语义相似性视角下的 LLM 生成新颖性

机器学习 2026-01-14 v2 人工智能 计算与语言

摘要

生成新颖性是衡量 LLM 泛化能力的关键指标,但相对于完整预训练语料库进行评估计算上具有挑战性。现有评估方法常依赖词汇重叠,无法检测改写文本,或未考虑完整预训练语料库。我们将新颖性定义为语义检索问题。这种定义使我们能够利用现代嵌入和索引管道,在预训练规模下高效地进行新颖性分析。具体而言,我们提出了一个三阶段框架:检索语义相似样本、在不同子序列长度上重新排序,并通过人类新颖性参考校准分数以实现可解释性。我们将该框架应用于 SmolLM 模型家族,报告了三个关键发现:(1) 模型在更长的序列上调用预训练数据,超出以前报告的范围;(2) 某些任务领域系统性地促进或抑制生成新颖性;(3) 指令微调不仅改变风格,还增加了新颖性。这些结果凸显了语义新颖性分析在研究泛化性方面的价值。为支持可重复性和进一步研究,我们在 https://huggingface.co/datasets/stai-tuebingen/faiss-smollm 发布了约 20 TB 的语料块和索引构件。

关键词

引用

@article{arxiv.2510.27313,
  title  = {LLM generation novelty through the lens of semantic similarity},
  author = {Philipp Davydov and Ameya Prabhu and Matthias Bethge and Elisa Nguyen and Seong Joon Oh},
  journal= {arXiv preprint arXiv:2510.27313},
  year   = {2026}
}