中文

HPS:面向人类偏好对齐的硬偏好抽样

人工智能 2026-03-23 v5

摘要

与人类偏好一致地生成大语言模型(LLM)响应对于构建安全可控的 AI 系统至关重要。虽然基于 Plackett-Luce(PL)和 Bradley-Terry(BT)模型的偏好优化方法显示出前景,但面临诸多挑战,如对有害内容的处理不佳、低效利用不偏好响应以及针对 PL 模型的高计算成本。为此,我们提出 Hard Preference Sampling(HPS),一种用于稳健高效人类偏好对齐的新框架。HPS 引入一种训练损失,优先选择最受偏好的响应,同时拒绝所有不偏好且有害的响应。它强调“硬”不偏好响应——即与受偏好响应高度相似的响应——以增强模型的拒绝能力。通过采用单样本蒙特卡洛抽样策略,HPS 在保持对齐质量的同时大幅降低计算开销。理论上,HPS 优于现有 PL 方法的样本效率更高,最大化受偏好响应与不偏好响应之间的奖励间隔,确保更清晰的区分。在 HH-RLHF 和 PKU-Safety 数据集上的实验表明,HPS 的有效性得到验证,虽然 BLEU 和奖励分数相当,但显著提高了奖励间隔,从而减少了有害内容的生成。

关键词

引用

@article{arxiv.2502.14400,
  title  = {HPS: Hard Preference Sampling for Human Preference Alignment},
  author = {Xiandong Zou and Wanyu Lin and Yuchen Li and Pan Zhou},
  journal= {arXiv preprint arXiv:2502.14400},
  year   = {2026}
}