中文

通过偏好维度扩展解释并打破安全性与有用性天花板

人工智能 2026-05-14 v2

摘要

在大语言模型的多目标对齐领域,平衡不同的人类偏好常表现为一种零和冲突。具体而言,竞争目标之间的内在张力决定了,激进地优化一个指标(如有用性)往往会对另一个指标(如无害性)造成显著损失。虽然先前的工作主要集中在训练过程中的数据选择、参数合并或算法平衡,但这些方法仅仅是在固定的帕累托前沿上迫使不同偏好之间做出妥协,未能从根本上解决固有的权衡问题。在本工作中,我们从多维奖励这一新颖视角切入该问题。通过扩大模型的 rollout 规模并分析不同奖励维度上的输出,我们得出一个关键结论:多目标之间的冲突源于提示本身固有地限制了可达到的多维奖励。基于这一核心观察,我们提出了 MORA:多目标奖励同化。具体而言,MORA 通过预采样分离出单一奖励提示,并通过重写原始问题以融入多维意图来扩展其奖励多样性。大量实验表明:(1)在顺序对齐中,MORA 在有用、无害和真实维度上进行多偏好对齐后,实现了 5% 至 12.4% 的单偏好改进,其中在无害性方面的提升尤为显著。(2)在同时对齐中,MORA 实现了平均 4.6% 的整体奖励提升。我们的代码可在 https://github.com/Shiying-Huang/MORA-MPA 获取。

关键词

引用

@article{arxiv.2605.11679,
  title  = {Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion},
  author = {ShiYing Huang and Liang Lin and Yuer Li and Kaiwen Luo and Zhenhong Zhou and An Zhang and Junhao Dong and Kun Wang and Zhigang Zeng},
  journal= {arXiv preprint arXiv:2605.11679},
  year   = {2026}
}