中文

从学习到掌握:通过人类在环强化学习实现安全高效的真实世界自主驾驶

机器学习 2025-10-08 v1 人工智能

摘要

基于强化学习 (RL) 的自主驾驶具有重要潜力。然而,在实际场景中应用 RL 仍然具有挑战,主要由于需要实现安全、高效和稳健的学习。将人类专长纳入学习过程中可通过减少危险的探索和提高样本效率来克服这些挑战。本文提出了一种奖励自由、主动的人类在环学习方法,称为 Human-Guided Distributional Soft Actor-Critic (H-DSAC)。我们的方法将 Proxy Value Propagation (PVP) 和 Distributional Soft Actor-Critic (DSAC) 结合起来,可在实际环境中实现高效和安全的训练。关键创新是构建 DSAC 框架内的分布式代理价值函数。该函数通过为专家演示分配更高的预期回报并对需要人类干预的动作进行惩罚来编码人类意图。通过对未标记状态的外推,这些标签有效地引导策略向专家式行为发展。通过设计良好的状态空间,我们的方法在实际训练时间内实现了真实世界驾驶策略的学习。来自模拟和真实世界实验的结果表明,我们的框架为自主驾驶实现了安全、稳健和样本高效的学习。

关键词

引用

@article{arxiv.2510.06038,
  title  = {From Learning to Mastery: Achieving Safe and Efficient Real-World Autonomous Driving with Human-In-The-Loop Reinforcement Learning},
  author = {Li Zeqiao and Wang Yijing and Wang Haoyu and Li Zheng and Li Peng and Liu Wenfei and Zuo Zhiqiang},
  journal= {arXiv preprint arXiv:2510.06038},
  year   = {2025}
}