自主赛车中的奖励信号设计
机器人学
2024-10-28 v2
摘要
强化学习(RL)已被证明是训练自主运动规划神经网络的宝贵工具。RL在特定问题上的应用依赖于奖励信号以量化某动作的好坏程度。本文针对自主赛车局部规划背景下的机器人控制,研究奖励信号设计问题。我们旨在设计能够在多个相互竞争的连续指标上表现良好的奖励信号。考虑并评估了基于位置、基于速度和基于动作的三种奖励方法,应用于F1/10th赛车。提出了一种基于智能体状态相对于最优轨迹进行奖励的新方法。智能体在仿真中训练与测试,并根据平均圈速与完成率比较各奖励信号所产生的行为。结果表明,基于距最小曲率轨迹的距离与速度的奖励可产生最快圈速。
引用
@article{arxiv.2103.10098,
title = {Reward Signal Design for Autonomous Racing},
author = {Benjamin Evans and Herman A. Engelbrecht and Hendrik W. Jordaan},
journal= {arXiv preprint arXiv:2103.10098},
year = {2024}
}
备注
6 pages, 10 Figures, This work has been submitted to the IEEE for possible publication