中文

KOI:通过混合关键状态引导加速在线模仿学习

机器人学 2024-10-18 v3 人工智能

摘要

在线模仿学习面临着广泛的在线探索空间与有限的专家轨迹之间的差距,由于奖励估计不准确而阻碍了高效探索。受认知神经科学发现的启发,我们假设智能体可以通过将目标任务分解为“做什么”的目标和“如何做”的机制,来估计精确的任务感知奖励以实现高效的在线探索。在这项工作中,我们提出了混合关键状态引导的在线模仿(KOI)学习方法,该方法利用语义关键状态和运动关键状态的整合作为奖励估计的指导。最初,我们利用视觉-语言模型从专家轨迹中提取语义关键状态,以指示“做什么”的目标。在语义关键状态之间的间隔内,我们采用光流来捕捉运动关键状态,以理解“如何做”的机制。通过对混合关键状态的全面掌握,我们优化了轨迹匹配奖励计算,从而以任务感知的探索加速在线模仿学习。我们不仅评估了Meta-World和LIBERO环境中任务的成功率,还评估了在线模仿学习过程中的方差趋势,证明了我们的方法具有更高的样本效率。我们还进行了真实的机器人操作实验来验证我们方法的有效性,展示了KOI方法的实际应用价值。视频和代码可在 https://gewu-lab.github.io/Keystate_Online_Imitation/ 获取。

关键词

引用

@article{arxiv.2408.02912,
  title  = {KOI: Accelerating Online Imitation Learning via Hybrid Key-state Guidance},
  author = {Jingxian Lu and Wenke Xia and Dong Wang and Zhigang Wang and Bin Zhao and Di Hu and Xuelong Li},
  journal= {arXiv preprint arXiv:2408.02912},
  year   = {2024}
}

备注

Accepted by CoRL 2024