从群体偏好中隐式学习安全对齐
人工智能
2026-05-22 v1
摘要
强化学习从人类反馈(Reinforcement Learning from Human Feedback, RLHF)可以揭示超越任务完成之外的隐式目标,如安全考量。在本工作中,我们关注群体偏好数据集中嵌入的常见安全准则,其中不同用户可能表达不同的偏好或目标,却遵循相似的安全原则。我们的目标是从群体偏好中发现共享的安全准则,然后将其传递到下游RL任务中,以正则化智能体行为并强制执行安全措施。我们首先表明,直接奖励组合——即优化偏好学习奖励模型与下游任务奖励的组合——存在内在局限性。灵感来自这一点,我们提出了基于群体偏好安全强化学习(Safe Crowd Preference-based RL),是一个层次框架,从群体偏好中提取安全对齐技能,并通过高层策略对其进行组合,以安全方式解决下游任务。实验在安全RL环境和一个包含多样用户目标和共享安全约束的初步LLM风格任务上均表明,我们的方法在不获取显式安全奖励的情况下显著降低了安全成本,同时实现了与拥有真实安全信号的预选方法相当的任务性能。
引用
@article{arxiv.2605.21822,
title = {Implicit Safety Alignment from Crowd Preferences},
author = {Qian Lin and Daniel S. Brown},
journal= {arXiv preprint arXiv:2605.21822},
year = {2026}
}
备注
Accepted to ICML 2026. Conference paper