中文

基于后继特征并发组合的多任务强化学习在连续控制中的应用

机器人学 2024-04-30 v2

摘要

深度强化学习(DRL)框架日益用于解决机器人中的高维连续控制任务。然而,由于样本效率不足,在机器人领域应用 DRL 进行在线学习在实践中仍不可行。一个原因是 DRL 智能体未将先前任务的解决方案用于新任务。近期基于后继特征(SFs)的多任务 DRL 智能体研究在提升样本效率方面颇具前景。本工作中,我们提出一种新方法,统一了先前的两种多任务 RL 框架 SF-GPI 与值组合,并将其适配到连续控制领域。我们利用后继特征的组合性质,从一组基元中组合出策略分布,而无需训练任何新策略。最后,为展示多任务机制,我们提出了基于 IsaacGym 的概念验证基准环境 Pointmass 和 Pointer,其支持大规模并行化以加速实验。实验结果表明,我们的多任务智能体在单任务性能上与 soft actor-critic(SAC)相当,且能成功迁移至新的未见任务。我们将代码开源至 "https://github.com/robot-perception-group/concurrent_composition" 以惠及社区。

关键词

引用

@article{arxiv.2303.13935,
  title  = {Multi-Task Reinforcement Learning in Continuous Control with Successor Feature-Based Concurrent Composition},
  author = {Yu Tang Liu and Aamir Ahmad},
  journal= {arXiv preprint arXiv:2303.13935},
  year   = {2024}
}