中文

超越期望值的安全RLHF:基于随机支配的通用谱风险控制

机器学习 2026-03-12 v1 人工智能

摘要

安全强化学习从人类反馈(RLHF)通常通过期望成本约束来实现安全,但期望只捕捉成本分布的单个统计量,无法 account for 分布式不确定性,特别是在重尾或罕见灾难性事件的情况下。当鲁棒性和风险敏感性至关重要时,这一限制就成为问题。随机支配提供了一种原则方法,通过比较整个成本分布而不仅仅是平均值,从而实现对尾部风险和潜在离群分布失败的直接控制。本文提出了一种新的对齐框架Risk-sensitive Alignment via Dominance(RAD),将标量期望成本约束替换为一阶随机支配(FSD)约束。我们通过在最优传输(OT)框架内,将目标策略的成本分布与参考策略的成本分布进行比较,使用熵正则化和Sinkhorn迭代获得可微分且计算高效的目标函数,以实现稳定的端到端优化。此外,我们引入分位数加权FSD约束,表明加权FSD普遍控制广泛的谱风险度量(SRMs),即在加权支配上的改进意味着对应谱风险的保证性改进。这为通过分位数加权函数调节模型风险轮廓提供了原则机制。实验结果表明,RAD在无害性方面优于基线方法,同时在有用性方面保持竞争力,并在离群分布无害性评估中表现出更大的鲁棒性。

关键词

引用

@article{arxiv.2603.10938,
  title  = {Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control},
  author = {Yaswanth Chittepu and Ativ Joshi and Rajarshi Bhattacharjee and Scott Niekum},
  journal= {arXiv preprint arXiv:2603.10938},
  year   = {2026}
}