基于 QPHIL 的导航:用于分层隐式 Q 学习的量化规划器
机器学习
2024-11-13 v1 人工智能
机器人学
摘要
离线强化学习(RL)已成为在各种领域(特别是复杂导航任务)中进行行为建模的模仿学习的有力替代方案。离线 RL 面临的一个现有挑战是信噪比,即如何缓解因价值估计误差导致的错误策略更新。为此,多项工作已证明了分层离线 RL 方法的优势,该方法将高层路径规划与低层路径跟踪解耦。在本工作中,我们提出了一种基于学习空间量化器的新型分层 Transformer 方法。这种量化使得能够训练更简单的区域条件低层策略,并简化了规划,将其简化为离散自回归预测。除其他优势外,规划中的区域级推理实现了显式轨迹拼接,而非基于噪声价值函数估计的隐式拼接。通过将这种基于 Transformer 的规划器与离线 RL 的最新进展相结合,我们提出的方法在复杂长距离导航环境中取得了最先进的结果。
引用
@article{arxiv.2411.07760,
title = {Navigation with QPHIL: Quantizing Planner for Hierarchical Implicit Q-Learning},
author = {Alexi Canesse and Mathieu Petitbois and Ludovic Denoyer and Sylvain Lamprier and Rémy Portelas},
journal= {arXiv preprint arXiv:2411.07760},
year = {2024}
}
备注
Under review. Code will be released upon acceptance