非平稳环境下基于推测式在线前瞻适应的自适驾驶
机器人学
2023-03-09 v3
摘要
在深度表征学习的驱动下,强化学习(RL)提供了一种端到端学习框架,能够在无需人工设计的情况下解决自动驾驶(SD)任务。然而,时变的非平稳环境会导致训练有素但专门化的 RL 策略在执行时失效。例如,在晴天训练的基于 RL 的 SD 策略在雨天泛化性能不佳。尽管元学习使 RL 智能体能够适应新任务/环境,但其离线操作在面对非平稳环境时未能赋予智能体在线适应能力。本工作提出一种基于推测式在线前瞻适应(COLA)的在线元强化学习算法。COLA 通过在前瞻时域内最大化智能体对未来性能的推测,来确定每一步的在线适应。实验结果表明,在动态变化的天气和光照条件下,基于 COLA 的自适应驾驶在在线适应性方面优于基线策略。演示视频、源代码和附录可在 {\tt https://github.com/Panshark/COLA} 获取。
引用
@article{arxiv.2210.03209,
title = {Self-Adaptive Driving in Nonstationary Environments through Conjectural Online Lookahead Adaptation},
author = {Tao Li and Haozhe Lei and Quanyan Zhu},
journal= {arXiv preprint arXiv:2210.03209},
year = {2023}
}
备注
10 pages with appendices; Nov 2 update: fixed minor typos in the appendices; Mar 2 update: added funding information, remade some figures