中文

基于策略梯度的原始-对偶方法用于人类反馈的安全强化学习

机器学习 2026-04-22 v1

摘要

安全强化学习从人类反馈(Safe RLHF)近期在开发有帮助且无害的大型语言模型方面取得了实证成功,通过分离有帮助性和无害性的人类偏好实现。现有方法通常依赖从人类反馈拟合固定时限奖励模型,仅经验验证。在本文中,我们将安全RLHF形式化为无限时限折扣约束马尔可夫决策过程(CMDP),因为人类可能与模型进行持续的交互序列,而非单个有限episode内。我们提出两种Safe RLHF算法,不需要奖励模型拟合,与先前假设固定长度轨迹不同,支持训练期间的灵活轨迹长度。两种算法均基于原始-对偶方法,实现基于策略梯度迭代、轨迹样本长度和人类偏好查询次数的全局收敛保证,收敛速率为多项式时间。据我们所知,这是首次研究在人类反馈下对无限时限折扣CMDP进行建模,并建立全局非渐近收敛性。

关键词

引用

@article{arxiv.2604.19024,
  title  = {Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback},
  author = {Qiang Liu and Adrienne Kline and Ermin Wei},
  journal= {arXiv preprint arXiv:2604.19024},
  year   = {2026}
}