中文

AMPO:主动多偏好优化用于自对弈偏好选择

机器学习 2025-06-10 v2 人工智能 计算与语言

摘要

多偏好优化通过对比整个有帮助和不希望的响应,来丰富语言模型的对齐方式,从而为大型语言模型提供更丰富的训练信号。在自对弈对齐期间,这些模型会为每个查询产生大量候选答案,导致将所有响应纳入训练目标在计算上是不可行的。在本文中,我们提出了一种新方法,即主动多偏好优化(AMPO),它结合了在策略生成、多偏好组对抗损失和主动子集选择。具体而言,我们对大量候选响应进行评分和嵌入,然后选择一个小而有信息的子集,覆盖奖励极端值和distinct语义聚类,以进行偏好优化。我们的对抗训练方案能够识别不仅最佳和最差的答案,还能识别那些对鲁健对齐至关重要的细微、未被充分探索的模式。理论上,我们提供了使用主动选择方法进行期望奖励最大化的保证,实证上,AMPO在使用Llama 8B和Mistral 7B时,在AlpacaEval上实现了最先进的结果。我们在https://huggingface.co/Multi-preference-Optimization发布了我们的数据集。

关键词

引用

@article{arxiv.2502.18293,
  title  = {AMPO: Active Multi-Preference Optimization for Self-play Preference Selection},
  author = {Taneesh Gupta and Rahul Madhavan and Xuchao Zhang and Chetan Bansal and Saravan Rajmohan},
  journal= {arXiv preprint arXiv:2502.18293},
  year   = {2025}
}

备注

Accepted at ICML 2025