置信度控制探索:面向机器人导航的高效稀疏奖励策略学习
机器人学
2025-03-14 v9 人工智能
机器学习
摘要
强化学习(RL)是一种有前景的机器人导航方法,使机器人能通过试错学习。然而,现实世界机器人任务常受困于稀疏奖励,因 RL 的样本低效导致探索低效与次优策略。本工作中,我们提出置信度控制探索(CCE),一种在不修改奖励函数的情况下提升基于 RL 的机器人导航样本效率的新方法。不同于通过改动奖励可能引入不稳定的现有方法(如熵正则与奖励塑形),CCE 基于策略熵动态调整轨迹长度。具体而言,在不确定性高时缩短轨迹以增强探索,在置信度高时延长轨迹以优先利用。CCE 是受策略熵与梯度估计间理论关联启发的、有原则且实用的方案。它能无缝集成于同策略与异策略 RL 方法,且所需改动极小。我们在 REINFORCE、PPO 与 SAC 上于仿真及真实导航任务中验证 CCE。CCE 优于固定轨迹与熵正则基线,在固定训练样本预算下取得高 18% 成功率、短 20–38% 路径与低 9.32% 高程代价。最后,我们将 CCE 部署于 Clearpath Husky 机器人,证明其在复杂户外环境中的有效性。
引用
@article{arxiv.2306.06192,
title = {Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation},
author = {Bhrij Patel and Kasun Weerakoon and Wesley A. Suttle and Alec Koppel and Brian M. Sadler and Tianyi Zhou and Amrit Singh Bedi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2306.06192},
year = {2025}
}
备注
10 pages, 6 figures, 2 tables