近似下一策略抽样:取代深层强化学习中保守目标策略更新
机器学习
2026-05-08 v1
摘要
我们重访强化学习中的一个经典“鸡生蛋”问题:为安全改进策略,价值函数必须在更新后策略的状态访问分布上准确。该分布对状态的访问是未知的,无法对其进行抽样以用于训练价值函数。保守更新解决了这个问题,但代价是缩小策略更新。本文探索一种替代方案——近似下一策略抽样(Approximate Next Policy Sampling, ANPS)——通过修改训练分布而非约束策略更新来解决该问题。ANPS 的条件是训练数据的分布近似于下一策略的分布。为演示 ANPS 的可行性和有效性,我们引入稳定值近似策略迭代(Stable Value Approximate Policy Iteration, SV-API)。SV-API 修改标准的近似策略迭代循环,在固定目标策略的同时,由迭代更新的行为策略收集相关经验。只有在满足收敛准则后,才提交新的策略。若满足某些稳定性准则,更新被保证是安全的;否则,其安全性不低于标准近似策略迭代。将 SV-API 应用于 PPO 可得到 Stable Value PPO(SV-PPO),该方法在高维离散(Atari)和连续控制基准上表现出与或优于基线的性能,同时执行大量目标策略更新。这些结果表明,ANPS 作为解决这一经典 RL 挑战的新方法是可行的。
引用
@article{arxiv.2605.05481,
title = {Approximate Next Policy Sampling: Replacing Conservative Target Policy Updates in Deep RL},
author = {Dillon Sandhu and Ronald Parr},
journal= {arXiv preprint arXiv:2605.05481},
year = {2026}
}