C^2:通过耦合在线与离线强化学习的并行网络实现机器人协同设计
机器人学
2023-11-08 v3
摘要
随着计算能力的提升,使用数据驱动方法协同设计机器人的形态与控制器已成为一种有前景的途径。然而,大多数现有数据驱动方法需要针对每种形态训练控制器以计算适应度,这非常耗时。相比之下,双网络框架利用特定形态下各独立网络收集的数据来训练一个群体网络,该网络为形态优化提供代理函数。这种方法取代了对多样化候选体的传统评估,从而加快了训练速度。尽管取得了可观的结果,两个网络的在线训练制约了它们的性能。为解决此问题,我们提出了一种结合在线与离线强化学习(RL)方法的并行网络框架。通过灵活利用行为克隆项,我们实现了两个网络的有效结合。我们在模拟器中进行了多组对比实验,发现所提方法有效解决了双网络框架中存在的问题,带来了整体算法性能的提升。此外,我们在真实机器人上验证了该算法,证明了其在实际应用中的可行性。
引用
@article{arxiv.2209.06579,
title = {C^2:Co-design of Robots via Concurrent Networks Coupling Online and Offline Reinforcement Learning},
author = {Ci Chen and Pingyu Xiang and Haojian Lu and Yue Wang and Rong Xiong},
journal= {arXiv preprint arXiv:2209.06579},
year = {2023}
}