中文

面向不完美感知下的导航:基于保守化分割的安全强化学习

机器学习 2025-10-22 v1

摘要

可靠的安全关键环境导航需要精确的危险感知能力以及原则性的不确定性处理,以强化下游安全决策。尽管现有方法有效,但它们假设感知具备完美的危险检测能力,而不确定性感知方法缺乏有限样本保证。我们提出 COPPOL(Conformal-driven perception-to-policy learning),一种基于保守化的感知到策略学习方法,将分布自由的有限样本安全保证集成到语义分割中,生成具有严格界限的校准危险图,从而提高漏检检测的可靠性。这些图可为下游 RL 规划构建风险感知成本场。在两个卫星数据集上,COPPOL 将危险覆盖率提高了最高可达 6 倍,实现了对不安全区域的近完整检测,同时在导航期间降低了危险违规率(最高可降低约 50%)。更重要的是,我们的方法在分布迁移下仍保持鲁健性,既保障了安全性,又维持了效率。

关键词

引用

@article{arxiv.2510.18485,
  title  = {Learning to Navigate Under Imperfect Perception: Conformalised Segmentation for Safe Reinforcement Learning},
  author = {Daniel Bethell and Simos Gerasimou and Radu Calinescu and Calum Imrie},
  journal= {arXiv preprint arXiv:2510.18485},
  year   = {2025}
}