基于混合模仿-强化学习架构的自主赛车
机器人学
2022-11-29 v2 人工智能
机器学习
神经与进化计算
摘要
在这项工作中,我们提出了一种严格的端到端控制策略,用于自主车辆在计时赛赛车事件中最小化圈速。我们还介绍了作为本研究项目一部分开发的AutoRACE模拟器,该模拟器用于模拟精确的车辆与环境动力学以及逼真的视听效果。我们采用混合模仿-强化学习架构,并精心设计了一种新颖的奖励函数,以训练深度神经网络策略在不到20小时内自主驾驶(使用模仿学习)和赛车(使用强化学习)。部署结果以10圈自主驾驶与10名不同人类玩家100圈手动驾驶的对比形式报告。自主智能体不仅以比最佳手动圈速快0.96秒的表现展现出优越性能,而且就平均圈速而言以1.46秒的优势压倒人类玩家。这种优势可通过自主智能体更好的轨迹优化和更短的反应时间来解释。
引用
@article{arxiv.2110.05437,
title = {Autonomous Racing using a Hybrid Imitation-Reinforcement Learning Architecture},
author = {Chinmay Vilas Samak and Tanmay Vilas Samak and Sivanathan Kandhasamy},
journal= {arXiv preprint arXiv:2110.05437},
year = {2022}
}