中文

NoveltyBench:评估语言模型生成人类样样多样性

计算与语言 2025-08-12 v4

摘要

语言模型在标准基准测试上展现出惊人的能力,但正日益受到模式崩溃的困扰,即无法生成多样且新颖的输出。我们的工作引入 NoveltyBench,旨在评估语言模型产生多个独特且高质量输出的能力。NoveltyBench利用精心挑选的提示以激发多样化答案,并筛选真实用户查询。我们评估了20个领先语言模型,发现当前最先进系统生成的多样性显著低于人类作家。值得注意的是,同一系列中较大的模型往往比较小的模型表现更差,这挑战了标准基准能力直接转化为生成实用性的观念。尽管诸如基于 in-context 再生的提示策略可激发多样性,但我们的发现凸显了当前模型在分布式多样性方面的根本性不足,降低了寻求多样化响应的用户效用,并暗示需要新的训练和评估范式在质量方面优先考虑多样性。

关键词

引用

@article{arxiv.2504.05228,
  title  = {NoveltyBench: Evaluating Language Models for Humanlike Diversity},
  author = {Yiming Zhang and Harshita Diddee and Susan Holm and Hanchen Liu and Xinyue Liu and Vinay Samuel and Barry Wang and Daphne Ippolito},
  journal= {arXiv preprint arXiv:2504.05228},
  year   = {2025}
}