中文

Hummer:面向有限竞争偏好数据集的探索

人工智能 2025-10-23 v4 机器学习

摘要

偏好数据集对于将人类偏好整合到预训练语言模型中发挥着关键作用,是强化学习从人类反馈成功的关键因素。然而,这些数据集常显示出相互冲突的对齐目标,导致模型更易受到 jailbreak 攻击,且在针对下游任务调整优先级时面临挑战。本文引入一种新型统计指标——对齐维度冲突(Alignment Dimension Conflict),用于量化偏好数据集中的冲突程度。随后,我们提出了 \texttt{Hummer} 及其细粒度变体 \texttt{Hummer-F} 作为具有减少冲突对齐目标的创新式两两偏好数据集。\texttt{Hummer} 基于 UltraFeedback 构建,并通过 GPT-4 的 AI 反馈得到增强,成为首个旨在减少对齐目标之间竞争的偏好数据集。进一步,我们开发了奖励模型 HummerRM 和 HummerRM-F,采用混合抽样方法有效平衡多样化的对齐目标。这种抽样方法使 HummerRM 成为进行领域特定精细调优和降低攻击脆弱性的理想模型。

关键词

引用

@article{arxiv.2405.11647,
  title  = {Hummer: Towards Limited Competitive Preference Dataset},
  author = {Li Jiang and Yusen Wu and Junwu Xiong and Jingqing Ruan and Yichuan Ding and Qingpei Guo and Zujie Wen and Jun Zhou and Xiaotie Deng},
  journal= {arXiv preprint arXiv:2405.11647},
  year   = {2025}
}