中文

TD-GRPC:带组相对策略约束的时序差分学习用于人形机器人运动

信息检索 2025-05-21 v1 人工智能

摘要

在高维控制设置中的人形机器人运动学习,对强化学习(RL)算法提出了持续的挑战,原因在于训练过程中存在不稳定动力学、复杂接触交互以及对分布偏移的敏感性。模型基方法,例如时序差分模型预测控制(TD-MPC),通过将短时域规划与基于价值的学习相结合,已展现出有前景的结果,为基本运动任务提供了高效解决方案。然而,这些方法在应对离线策略更新引入的策略不匹配和不稳定性方面仍然无效。因此,本工作中,我们引入了时序差分组相对策略约束(TD-GRPC),即 TD-MPC 框架的扩展,将组相对策略优化(GRPO)与显式策略约束(PC)相统一。TD-GRPC 在隐式策略空间中应用信任域约束,以维持规划先验与学习回放之间的一致性,同时利用组相对排序来评估和保持候选轨迹的物理可行性。与先前方法不同,TD-GRPC 在不修改底层规划器的前提下实现了鲁棒运动,使规划和策略学习更加灵活。我们在涵盖从基本行走至高度动态运动的运动任务套件上验证了本方法,在 26 自由度的 Unitree H1-2 人形机器人上进行训练。仿真结果表明,TD-GRPC 在训练复杂人形控制任务的同时,在稳定性和策略鲁棒性方面均有提升,并保持了采样效率。

关键词

引用

@article{arxiv.2505.13550,
  title  = {JIR-Arena: The First Benchmark Dataset for Just-in-time Information Recommendation},
  author = {Ke Yang and Kevin Ros and Shankar Kumar Senthil Kumar and ChengXiang Zhai},
  journal= {arXiv preprint arXiv:2505.13550},
  year   = {2025}
}