中文

基于有效子目标引导的非专家观察下的目标到达策略学习

机器学习 2024-09-09 v1 机器人学

摘要

在本工作中,我们解决了从非专家、无动作观察数据中进行长期目标到达策略学习的挑战性问题。不同于完全标记的专家数据,您的数据更易获取,避免了昂贵的动作标注过程。此外,与在线学习相比,后者通常涉及无目的的探索,而您的数据为更高效的探索提供了有用的指导。为实现目标,我们提出了一种新颖的子目标引导学习策略。这种策略的动机是,长期目标为高效探索和准确状态转换提供的指导有限。我们开发了一种基于扩散策略的高级策略,用于生成合理的子目标作为路标,优先选择更容易导向最终目标的状态。此外,我们学习状态-目标价值函数,以鼓励高效地到达子目标。这两个组件自然地集成到 off-policy actor-critic 框架中,通过信息丰富的探索实现目标达成。我们在复杂的机器人导航和操控任务上评估了该方法,证明其在现有方法之上的显著性能优势。我们的消融研究进一步表明,该方法对各种损坏的观察数据具有鲁棒性。

关键词

引用

@article{arxiv.2409.03996,
  title  = {Goal-Reaching Policy Learning from Non-Expert Observations via Effective Subgoal Guidance},
  author = {RenMing Huang and Shaochong Liu and Yunqiang Pei and Peng Wang and Guoqing Wang and Yang Yang and Hengtao Shen},
  journal= {arXiv preprint arXiv:2409.03996},
  year   = {2024}
}

备注

Accepted to CoRL 2024