将成功条件化作为策略改进:模仿成功所求解的优化问题
人工智能
2026-01-27 v1 机器学习
系统与控制
系统与控制
机器学习
摘要
一种广泛使用的策略改进技术是成功条件化,即收集轨迹,识别出实现预期结果的轨迹,并更新策略以模仿成功轨迹中所采取的动作。这一原理以许多名称出现——带 SFT 的拒绝采样、目标条件强化学习、Decision Transformers——然而它究竟求解了什么优化问题(如果有的话)一直不清楚。我们证明,成功条件化精确求解了一个信赖域优化问题,即在 散度约束下最大化策略改进,其约束半径由数据自动确定。这产生了一个恒等式:相对策略改进、策略改变幅度以及我们称之为动作影响(衡量动作选择的随机变化如何影响成功率)的量,在每个状态下都精确相等。因此,成功条件化表现为一个保守的改进算子。精确的成功条件化不会降低性能或引发危险的分布偏移,但当其失败时,其失败方式是可观察的,即几乎不改变策略。我们将我们的理论应用于回报阈值化的常见做法,表明这可以放大改进,但代价是可能与真实目标不一致。
引用
@article{arxiv.2601.18175,
title = {Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success},
author = {Daniel Russo},
journal= {arXiv preprint arXiv:2601.18175},
year = {2026}
}