奖励-策略图中的政策悬崖:大语言模型的理论分析
人工智能
2025-07-29 v1 计算与语言
机器学习
摘要
强化学习(RL)在塑造大型语言和推理模型(LLMs/LRMs)行为方面发挥着关键作用。然而,它常产生脆弱且不稳定的策略,导致诡异推理、误导性对齐和指令违反等关键性故障,削弱了LLMs/LRMs的可信度和安全性。目前,这些问题缺乏统一的理论解释,通常通过经验法则加以解决。本文为分析奖励函数到最优策略之间映射的稳定性提供了一个严格的数学框架。我们指出,政策脆弱性常常源于最优动作的非唯一性,这在推理任务中存在多个有效轨迹时常见。这一理论视角为一系列看似不相关的故障提供了统一解释,将其重新框定为优化可能不完整或噪声的奖励所致的理性结果,尤其是在动作退行性存在时。我们将该分析从基本的单奖励设置扩展到更现实的多奖励RL,并展示稳定性由一种"有效奖励"聚合机制所主导。我们还证明熵正则化可以在增加随机性的代价下恢复政策稳定性。本框架为最近关于误导推理、指令遵循权衡以及RLHF引发的欺骗性行为提供了统一解释,并通过多奖励RL中的扰动实验得到进一步验证。这一工作将政策稳定性分析从经验法则推向原则理论,为设计更安全可信的AI系统提供了必需的见解。
引用
@article{arxiv.2507.20150,
title = {The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models},
author = {Xingcheng Xu},
journal= {arXiv preprint arXiv:2507.20150},
year = {2025}
}