将组相对策略优化扩展至连续控制:面向机器人强化学习的理论框架
机器人学
2025-07-29 v1 人工智能
摘要
组相对策略优化 (GRPO) 通过基于组的优势估计消除了对价值函数的依赖,在离散动作空间中展现出潜力。然而,其在连续控制中的应用仍未被探索,这限制了其在连续动作至关重要的机器人领域中的实用性。本文提出了一个将 GRPO 扩展至连续控制环境的理论框架,以应对高维动作空间、稀疏奖励和时间动态方面的挑战。我们的方法引入了基于轨迹的策略聚类、状态感知的优势估计,以及专为机器人应用设计的正则化策略更新。我们提供了关于收敛性质和计算复杂度的理论分析,为未来在包括移动和操作任务在内的机器人系统中的实证验证奠定了基础。
引用
@article{arxiv.2507.19555,
title = {Extending Group Relative Policy Optimization to Continuous Control: A Theoretical Framework for Robotic Reinforcement Learning},
author = {Rajat Khanda and Mohammad Baqar and Sambuddha Chakrabarti and Satyasaran Changdar},
journal= {arXiv preprint arXiv:2507.19555},
year = {2025}
}
备注
13 pages, 2 figures