HG2P:受鼓膜腹侧核双控制器启发的高奖励图与无模型 Q-梯度惩罚用于路径规划与运动控制
机器学习
2025-04-15 v2 神经与进化计算
摘要
目标条件分层强化学习 (HRL) 将复杂的到达任务分解为一系列简单子目标条件任务的序列,显示出针对大规模环境中长期规划的巨大潜力。本文构建了将基于图的目标条件 HRL 与脑机制联系起来的框架,提出了鼓膜腹侧核类似双控制器假设。受生物脑机制(即鼓膜腹侧核中观察到的高奖励偏好)和实例理论的启发,我们提出了用于构建记忆图的高回报抽样策略,以提高样本效率。此外,我们推导了无模型的低层 Q 函数梯度惩罚,以解决先前工作中存在的模型依赖问题,提高在实际应用中的 Lipschitz 约束的泛化能力。最后,我们将这两个扩展(High-reward Graph 与 model-free Gradient Penalty)整合到最先进的框架 ACLG 中,提出一种新的目标条件 HRL 框架 HG2P+ACLG。实验结果表明,我们的方法在各种长期导航任务和机器人操控任务上均优于最先进的目标条件 HRL 算法。
引用
@article{arxiv.2410.09505,
title = {HG2P: Hippocampus-inspired High-reward Graph and Model-Free Q-Gradient Penalty for Path Planning and Motion Control},
author = {Haoran Wang and Yaoru Sun and Zeshen Tang and Haibo Shi and Chenyuan Jiao},
journal= {arXiv preprint arXiv:2410.09505},
year = {2025}
}