具有阶段衰减裁剪的课程化近端策略优化用于无信号交叉口自动驾驶
机器人学
2023-09-26 v1
摘要
无信号交叉口通常被认为是自动驾驶车辆最具代表性和挑战性的场景之一。为应对此类场景中的自动驾驶问题,本文提出一种具有阶段衰减裁剪的课程化近端策略优化(CPPO)框架。通过在训练的不同阶段经由近端策略优化(PPO)调整裁剪参数,车辆可先以较大参数快速搜索近似最优策略或其邻域,再以较小参数收敛至最优策略。特别地,将基于阶段的课程学习技术纳入所提框架,以提升泛化性能并进一步加速训练过程。此外,针对不同课程设置专门设计了奖励函数。在具有双车道行车道的十字交叉场景中进行了一系列对比实验以验证所提CPPO方法的有效性。结果表明,相较于基线方法,所提方法对不同动态复杂环境表现出更好的适应性,且训练速度更快。
引用
@article{arxiv.2308.16445,
title = {Curriculum Proximal Policy Optimization with Stage-Decaying Clipping for Self-Driving at Unsignalized Intersections},
author = {Zengqi Peng and Xiao Zhou and Yubin Wang and Lei Zheng and Ming Liu and Jun Ma},
journal= {arXiv preprint arXiv:2308.16445},
year = {2023}
}
备注
7 pages, 4 figures