中文

多样化偏好学习:面向能力与对齐

计算与语言 2025-11-13 v1

摘要

大型语言模型能够代表多元视角的能力,日益影响社会。然而,最近的研究表明,对齐算法如 RLHF 和 DPO 显著降低了 LLM 输出的多样性。对齐后的大型语言模型生成的文本不仅结构和措辞重复,而且在解决问题的方式上更为统一,其回应也反映出更窄的社会视角范围。我们将这一问题归因于偏好学习算法中使用的 KL 散度正则化器。这导致模型系统性地偏重多数意见,在输出多样性方面付出代价。为此,我们提出 Soft Preference Learning 方法,通过解耦 KL 惩罚中的熵项和交叉熵项,允许对 LLM 生成多样性进行细粒度控制。从能力角度看,使用 Soft Preference Learning 训练的 LLM 在困难的重复抽样任务中取得更高准确率,生成的输出在语义和词汇多样性方面更佳。从对齐角度看,它们能够代表更广泛的社会观点,显示出 improved 的逻辑校准。值得注意的是,Soft Preference Learning 类似于但优于标准温度缩放。

关键词

引用

@article{arxiv.2511.08594,
  title  = {Diverse Preference Learning for Capabilities and Alignment},
  author = {Stewart Slocum and Asher Parker-Sartori and Dylan Hadfield-Menell},
  journal= {arXiv preprint arXiv:2511.08594},
  year   = {2025}
}