中文

FastTD3:用于人形机器人控制的简单、快速且强大的强化学习

机器人学 2025-06-03 v3 人工智能 机器学习

摘要

强化学习(RL)推动了机器人领域的显著进展,但其复杂性和漫长的训练时间仍是主要瓶颈。在本报告中,我们介绍了FastTD3,一种简单、快速且强大的RL算法,可显著加快人形机器人在HumanoidBench、IsaacLab和MuJoCo Playground等流行套件中的训练速度。我们的方案极其简单:我们训练了一个off-policy TD3智能体,并进行了若干修改——并行仿真、大批量更新、分布式评论家以及精心调整的超参数。FastTD3在单块A100 GPU上不到3小时内即可解决一系列HumanoidBench任务,且在训练过程中保持稳定。我们还提供了一个轻量且易于使用的FastTD3实现,以加速机器人领域的RL研究。

关键词

引用

@article{arxiv.2505.22642,
  title  = {FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control},
  author = {Younggyo Seo and Carmelo Sferrazza and Haoran Geng and Michal Nauman and Zhao-Heng Yin and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2505.22642},
  year   = {2025}
}

备注

Project webpage: https://younggyo.me/fast_td3