中文

从简单到复杂的知识迁移:一种安全高效的自动驾驶决策强化学习框架

机器人学 2024-11-05 v4

摘要

安全高效的决策系统对于自动驾驶汽车至关重要。然而,驾驶环境的复杂性限制了众多基于规则和机器学习方法的有效性。强化学习凭借其强大的自学习能力和环境适应性,为应对这些挑战提供了有前景的解决方案。然而,训练过程中的安全性和效率问题阻碍了其广泛应用。为解决这些问题,我们提出了一种新颖的强化学习框架——从简单到复杂协同决策(S2CD)。首先,我们在轻量级仿真环境中快速训练教师模型。在更复杂和真实的环境中,教师通过评估动作的价值来干预学生智能体的次优行为,以避免危险。我们还引入了一种名为自适应裁剪近端策略优化Plus的强化学习算法,该算法结合了教师和学生策略的样本,并采用基于样本重要性的动态裁剪策略。这种方法提高了样本效率,同时有效缓解了数据不平衡问题。此外,我们使用Kullback-Leibler散度作为策略约束,并通过拉格朗日方法将其转化为无约束问题,以加速学生的学习。最后,一种渐进式断奶策略确保学生随着时间的推移学会独立探索,克服教师的局限性并最大化性能。在高速公路变道场景中的仿真实验表明,与最先进的算法相比,S2CD框架提高了学习效率,降低了训练成本,并显著提升了安全性。该框架还确保了教师和学生模型之间的有效知识迁移,即使教师模型并非最优,学生也能获得卓越的性能,这证明了S2CD的鲁棒性和有效性。

关键词

引用

@article{arxiv.2410.14468,
  title  = {Knowledge Transfer from Simple to Complex: A Safe and Efficient Reinforcement Learning Framework for Autonomous Driving Decision-Making},
  author = {Rongliang Zhou and Jiakun Huang and Mingjun Li and Hepeng Li and Haotian Cao and Xiaolin Song},
  journal= {arXiv preprint arXiv:2410.14468},
  year   = {2024}
}