中文

面向自动驾驶中可信离线强化学习的安全感知因果表征

机器人学 2024-03-26 v3 人工智能 机器学习

摘要

在自动驾驶领域,离线强化学习(RL)方法在利用离线数据集解决序列决策问题方面表现出显著效能。然而,由于在离线数据集中缺失长尾与未预见场景,在多样安全关键场景中维持安全性仍是一项重大挑战。本文引入安全感知结构化场景表征(FUSION, saFety-aware strUctured Scenario representatION),一种离线RL中开创性的表征学习方法,通过利用结构化场景信息促进可泛化的端到端驾驶策略学习。FUSION利用分解的奖励、代价、状态与动作空间之间的因果关系,构建动态交通环境中结构化序列推理框架。我们在自动驾驶分布偏移的两种典型真实世界设定中开展广泛评估,相较当前最先进的安全RL与IL基线,展示了安全性代价与效用奖励间的良好平衡。各驾驶场景中的经验证据证实,即便面对艰巨与未见环境,FUSION也显著增强了自动驾驶智能体的安全性与泛化性。此外,我们的消融研究揭示了将因果表征整合进离线安全RL算法中的明显改进。我们的代码实现见:https://sites.google.com/view/safe-fusion/。

关键词

引用

@article{arxiv.2311.10747,
  title  = {Safety-aware Causal Representation for Trustworthy Offline Reinforcement Learning in Autonomous Driving},
  author = {Haohong Lin and Wenhao Ding and Zuxin Liu and Yaru Niu and Jiacheng Zhu and Yuming Niu and Ding Zhao},
  journal= {arXiv preprint arXiv:2311.10747},
  year   = {2024}
}