中文

正向唯一漂移策略优化

机器学习 2026-04-21 v1 机器人学

摘要

在在线强化学习领域,传统的高斯政策和基于流的方法常受限于单模表达性、复杂的梯度裁剪或严格的信任域要求。此外,它们都依赖对负样本的事后惩罚来纠正错误动作。本文引入正向唯一漂移策略优化(Positive-Only Drifting Policy Optimization, PODPO),一种无概率密度函数、无梯度裁剪的生成式在线RL方法。通过利用漂移模型,PODPO通过优势加权局部对比漂移执行政策更新。仅依赖正优势样本,PODPO优雅地将动作引导至高回报区域,同时利用生成模型的内在局部平滑性实现主动错误预防。如此,PODPO为在线环境中的生成式政策学习开辟了一条充满希望的新道路。

关键词

引用

@article{arxiv.2604.16519,
  title  = {Positive-Only Drifting Policy Optimization},
  author = {Qi Zhang},
  journal= {arXiv preprint arXiv:2604.16519},
  year   = {2026}
}

备注

12 pages, 6 figures