中文

多样性不等于短:提高语言模型响应多样性的长度控制数据选择策略

计算与语言 2026-02-02 v4

摘要

多样化的语言模型响应对创意生成、开放式任务和自我改进训练至关重要。我们表明,常见的多样性指标甚至连用于偏好优化的奖励模型都系统性地倾向于较短的输出,从而限制了表达能力。为此,我们提出Diverse, not Short(Diverse-NS),一种提高响应多样性同时保持长度平等的数据选择策略。通过生成和过滤在多样性、质量和长度之间进行平衡的偏好数据,Diverse-NS能够仅使用3,000个偏好对实现有效训练。应用于LLaMA-3.1-8B和Olmo-2系列模型后,Diverse-NS显著增强了词汇和语义多样性。在四项创意生成任务(Divergent Associations、Persona Generation、Alternate Uses和Creative Writing)上,我们发现长度偏差被显著解决后,方法在多样性方面 consistently 取得改进,尽管在响应质量上可能略有下降或提升。意外的是,对Olmo-2模型系列(7B和13B)的实验显示,较小的模型如Olmo-2-7B可以作为更大模型的有效“多样性教师”。通过显式解决长度偏差,我们的方法有效地将模型推向更具多样性和表达力的输出。

关键词

引用

@article{arxiv.2505.16245,
  title  = {Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models},
  author = {Vijeta Deshpande and Debasmita Ghose and John D. Patterson and Roger Beaty and Anna Rumshisky},
  journal= {arXiv preprint arXiv:2505.16245},
  year   = {2026}
}

备注

Accepted to EMNLP 2025 Main