评估LLM生成内容的多样性与质量
计算与语言
2026-02-27 v2 人工智能
摘要
近期的工作表明,偏好调优技术——如强化学习从人类反馈(RLHF)方法(如PPO和GRPO),以及像DPO这样的替代方法——会降低多样性,这在这些模型广泛部署于需要多样化输出的应用中形成一种困境。我们认为,在不考虑质量的情况下的多样性缺乏实际价值。为此,我们引入了一种衡量有效语义多样性的框架——即在满足质量阈值的输出之间的多样性,这更能反映大型语言模型(LLM)的实际效用。使用无需人工干预的开放式任务,我们发现了反直觉的结果:当使用不显式考虑质量的多样性指标时,偏好调优的模型——特别是通过RL训练的模型——往往产生较低的多样性;然而,这些相同偏好调优的模型在生成满足质量阈值的输出方面表现出更高的有效语义多样性。我们的分析进一步显示,一个趋势:虽然更大的模型可能在有效语义多样性方面优于较小的模型,但较小的模型在固定抽样预算内更高效地产生独特内容。这些发现对需要多样且高质量输出的应用具有实际意义,从创意辅助到合成数据生成。
引用
@article{arxiv.2504.12522,
title = {Evaluating the Diversity and Quality of LLM Generated Content},
author = {Alexander Shypula and Shuo Li and Botong Zhang and Vishakh Padmakumar and Kayo Yin and Osbert Bastani},
journal= {arXiv preprint arXiv:2504.12522},
year = {2026}
}
备注
Published at COLM 2025