策略优化偏向于最简路径
计算与语言
2025-10-28 v1
摘要
策略优化(PO)算法用于精炼大型语言模型以进行复杂的多步骤推理。当前的领先管道强制执行严格的思考后回答格式,以激发链式思维(CoT);然而,当这些刚性约束被放宽为开放式CoT结构时,PO的行为仍是一个鲜有人了解的问题。我们通过大套受控实验进行了广泛调查,识别出一个一致原则:策略优化持续遵循最简路径。在获得灵活性以在推理和响应之间交错时,策略优化持续学习丢弃显式推理,导致策略退化为直接的 <answer> 格式。这种结果在各种模型和算法之间都成立。我们发现,这种格式的崩溃即使在将复杂 <answer> 格式分配高达4倍的奖励权重后,也依然持久。我们通过一系列受控奖励分解实验 formalized 了这一原则,表明 PO 系统系统地优化最简奖励组件,这一偏好即使面对互斥选择或对更复杂行为的强烈激励也依然成立。最后,我们表明,对高奖励捷径的成功收敛并非低效漂移,而是由需要 KL 正则化策略具有足够自由度以从其初始先验显著偏移的优化过程驱动。我们的发现表明,授予策略以偏离自由度是一个双刃剑:既是发现高奖励捷径所必需的,又会为游戏化最简单奖励方面提供强大激励,构成对齐下的奖励作弊的关键挑战。
引用
@article{arxiv.2510.21853,
title = {Policy Optimization Prefers The Path of Least Resistance},
author = {Debdeep Sanyal and Aakash Sen Sharma and Dhruv Kumar and Saurabh Deshpande and Murari Mandal},
journal= {arXiv preprint arXiv:2510.21853},
year = {2025}
}
备注
21 pages, 8 figures, 2 tables