中文

时空变化标量场中最小暴露路径的逆强化学习

机器学习 2025-03-11 v1 系统与控制 系统与控制

摘要

自动驾驶汽车的性能和可靠性分析可以从“放大”小数据集以合成大量合理的自动驾驶汽车行为样本的工具中受益。我们考虑了这一数据合成问题的一个具体实例,即在前往固定目标位置的行程中,解决自动驾驶汽车对不利环境条件暴露的最小化问题。环境由威胁场表征,这是一个严格正的标量场,其较高强度对应于对自动驾驶汽车不利和恶劣的条件。我们解决了合成最小暴露路径数据集的问题,这些路径需类似于此类路径的训练数据集。本文的主要贡献是解决该问题的逆强化学习 (IRL) 模型。我们考虑了时不变(静态)和时变(动态)威胁场。我们发现,当威胁场与训练中使用的威胁场相同时,所提出的 IRL 模型在从训练数据集中未见过的初始条件合成路径方面表现出优异的性能。此外,我们在未见过的威胁场上评估了模型性能,并发现该情况下的误差也很低。最后,我们展示了该模型在具有不同特征的不同数据集上训练时合成不同数据集的能力。

关键词

引用

@article{arxiv.2503.06611,
  title  = {Inverse Reinforcement Learning for Minimum-Exposure Paths in Spatiotemporally Varying Scalar Fields},
  author = {Alexandra E. Ballentine and Raghvendra V. Cowlagi},
  journal= {arXiv preprint arXiv:2503.06611},
  year   = {2025}
}

备注

Joint submission to MECC-JAVS 2025