使用基于贝叶斯优化的课程学习提升自动驾驶深度强化学习方法的环境鲁棒性
机器人学
2023-12-19 v1 机器学习
摘要
深度强化学习(RL)方法已被广泛应用于大量机器人任务中,例如机器人操作和自动驾驶。然而,深度RL中的一个开放问题是学习对环境变化具有鲁棒性的策略,这是此类系统部署到真实世界非结构化环境中的重要条件。课程学习是一种已被应用于提升监督学习和强化学习领域泛化性能的方法,但选择合适的课程以实现鲁棒性可能是一个需要大量用户参与的过程。在我们的工作中,我们展示了使用贝叶斯优化对潜在的课程-奖励函数进行概率推断,可以成为寻找鲁棒课程的一种有前景的技术。我们证明了在具有避障功能的自动驾驶领域,通过贝叶斯优化找到的课程可以优于原始深度RL智能体和人工设计的课程。我们的代码可在 https://github.com/PRISHIta123/Curriculum_RL_for_Driving 获取。
引用
@article{arxiv.2312.10557,
title = {Improving Environment Robustness of Deep Reinforcement Learning Approaches for Autonomous Racing Using Bayesian Optimization-based Curriculum Learning},
author = {Rohan Banerjee and Prishita Ray and Mark Campbell},
journal= {arXiv preprint arXiv:2312.10557},
year = {2023}
}
备注
Accepted to the IROS 2023 Workshop on Learning Robot Super Autonomy. The first two authors contributed equally