基于风险感知逐步对齐的约束语言模型策略优化
人工智能
2026-01-01 v1
摘要
在微调预训练语言模型(LM)以展现期望行为时,保持对风险的控制对于确保安全性和可信度至关重要。大多数现有的安全对齐方法,如Safe RLHF和SACPO,通常在风险中性的范式下运行,这不足以应对因偏离参考策略而产生的风险,并且对罕见但可能造成灾难性后果的有害行为提供的鲁棒性有限。为了解决这一局限性,我们提出了风险感知逐步对齐(RSA),这是一种新颖的对齐方法,通过利用一类嵌套风险度量,将风险意识明确地纳入策略优化过程。具体来说,RSA将安全对齐形式化为一个标记级别的风险感知约束策略优化问题,并通过一个逐步对齐程序来解决,该程序产生源自嵌套风险度量的标记级别策略更新。这种设计提供了两个关键优势:(1)它减轻了因模型过度偏离参考策略而引发的风险,(2)它明确抑制了低概率但高影响的有害行为。此外,我们在温和假设下提供了关于策略最优性的理论分析。实验结果表明,我们的方法在确保强大安全性的同时实现了高水平的帮助性,并显著抑制了尾部风险,即低概率但高影响的不安全响应。
引用
@article{arxiv.2512.24263,
title = {Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment},
author = {Lijun Zhang and Lin Li and Wei Wei and Yajie Qi and Huizhong Song and Jun Wang and Yaodong Yang and Jiye Liang},
journal= {arXiv preprint arXiv:2512.24263},
year = {2026}
}