中文

CONTHER:基于 Hindsight Experience Replay 和 Transformer 的类人情境机器人学习(无需专家演示)

机器人学 2025-03-21 v1

摘要

本文提出了 CONTHER,一种 novel 的强化学习算法,用于高效快速训练以目标导向的操控任务和障碍规避。该算法采用受 Hindsight Experience Replay (HER) 启发的修改型回放缓冲区,通过人工生成成功轨迹来丰富经验,从而解决稀疏奖励问题,无需手动收集专家演示。算法提出了基于 Transformer 的架构,以整合前一状态的上下文,使智能体能够进行更深入的分析并做出类似人类学习方式的决策。内置的回放缓冲区作为“内部示范者”具有双重作用:一方面加速学习,另一方面使算法能够适应不同任务。经验数据确认了该算法平均比其他方法高出 38.46%,相较于最成功的基线高出 28.21%,在点到达任务中实现更高的成功率和更快的收敛速度。由于控制通过机器人关节实现,算法可便于适配实际机器人系统并构建障碍规避任务。因此,该算法也已用于需要遵循复杂动态轨迹和障碍规避的任务。该算法的设计使其能够适用于广泛的目标导向任务,为实际机器人应用提供了易于集成的解决方案。

关键词

引用

@article{arxiv.2503.15895,
  title  = {CONTHER: Human-Like Contextual Robot Learning via Hindsight Experience Replay and Transformers without Expert Demonstrations},
  author = {Maria Makarova and Qian Liu and Dzmitry Tsetserukou},
  journal= {arXiv preprint arXiv:2503.15895},
  year   = {2025}
}

备注

Submitted to IROS 2025