基于人类对齐奖励标签的离线强化学习在遮挡行人跨越场景中的自主紧急制动
机器人学
2026-01-27 v2 机器学习
摘要
有效利用真实驾驶数据集对提升自动驾驶系统的训练至关重要。虽然离线强化学习能够利用此类数据训练自动驾驶车辆,但大多数可用数据集缺乏有意义的奖励标签。奖励标签至关重要,因为它们为学习算法提供反馈,使其能够区分可取与不可取的行为,从而提高策略性能。本文提出了一种生成人类对齐奖励标签的新方法。该方法解决了真实数据集中缺失奖励信号的挑战,通过生成反映人类判断和安全性考虑的标签。奖励函数包含一种自适应安全组件,其通过分析语义分割图而被激活,使自动驾驶车辆在潜在碰撞场景中能够优先考虑安全而非效率。该方法应用于遮挡行人跨越场景中具有不同行人流量的情形,使用仿真数据。当使用生成的奖励训练各种离线强化学习算法时,每个模型都产生了有意义的策略,证明了该方法的可行性。此外,该方法还应用于 Audi Autonomous Driving 数据集的子集,生成的奖励标签与人工标注的奖励标签进行了比较。研究结果显示,两组奖励标签之间存在一定的差异,而最有趣的是,该方法标记了人工标注者遗漏的不安全状态。
引用
@article{arxiv.2504.08704,
title = {Offline Reinforcement Learning using Human-Aligned Reward Labeling for Autonomous Emergency Braking in Occluded Pedestrian Crossing},
author = {Vinal Asodia and Barkin Dagda and Yinglong He and Zhenhua Feng and Saber Fallah},
journal= {arXiv preprint arXiv:2504.08704},
year = {2026}
}
备注
39 pages, 14 figures, 1 table