中文

QuasiNav: 基于约束拟度量强化学习的非对称代价感知导航规划

机器人学 2024-10-23 v1 机器学习

摘要

在非结构化户外环境中的自主导航本质上具有挑战性,因为存在非对称的通行代价,例如上坡与下坡运动所需的能量消耗不同。传统的强化学习方法通常假设对称代价,这可能导致次优的导航路径,并在实际场景中增加安全风险。在本文中,我们介绍了QuasiNav,一个新颖的强化学习框架,它集成了拟度量嵌入来显式建模非对称代价,并引导高效、安全的导航。QuasiNav将导航问题形式化为一个约束马尔可夫决策过程(CMDP),并采用拟度量嵌入来捕捉方向依赖的代价,从而更准确地表示地形。该方法与约束策略优化框架内的自适应约束收紧相结合,以在学习过程中动态执行安全约束。我们在三个具有挑战性的导航场景——起伏地形、非对称山坡穿越和方向依赖地形穿越——中验证了QuasiNav,展示了其在模拟和真实环境中的有效性。实验结果表明,QuasiNav显著优于传统方法,实现了更高的成功率、更高的能源效率以及更好的安全约束遵守。

关键词

引用

@article{arxiv.2410.16666,
  title  = {QuasiNav: Asymmetric Cost-Aware Navigation Planning with Constrained Quasimetric Reinforcement Learning},
  author = {Jumman Hossain and Abu-Zaher Faridee and Derrik Asher and Jade Freeman and Theron Trout and Timothy Gregory and Nirmalya Roy},
  journal= {arXiv preprint arXiv:2410.16666},
  year   = {2024}
}

备注

Under Review for ICRA 2025