中文

质量约束下的熵最大化策略优化:面向LLM多样性

计算与语言 2026-05-28 v2 机器学习

摘要

在许多大型语言模型(LLM)对齐应用中,用户期望的不仅是高质量的输出,还要有 substantial diversity。然而,现有方法常面临根本性的权衡:提升输出质量的做法往往会降低多样性,而增加多样性的方法又往往以牺牲质量为代价。本文提出质量约束熵最大化策略优化(Quality-constrained Entropy Maximization Policy Optimization, QEMPO),这是一种新型框架,通过显式保留输出质量来增强LLM输出的多样性。QEMPO建立在坚实的理论基础之上:我们推导出可证明最大化熵——即一种原则性的多样性度量——的闭式解析解,同时在定义的目标下提供最优性保证。凭借这一解,QEMPO自然支持在线和离线训练设置。实证结果表明,QEMPO在不牺牲质量的前提下持续提高输出多样性,在许多情况下在两个维度上都实现了提升,与我们的理论保证相吻合。

关键词

引用

@article{arxiv.2602.15894,
  title  = {Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity},
  author = {Haihui Pan and Yuzhong Hong and Kaichen Zhang and Shaoke Lv and Junwei Bao and Hongfei Jiang and Yang Song},
  journal= {arXiv preprint arXiv:2602.15894},
  year   = {2026}
}