单重置 divide & conquer 模仿学习
机器人学
2024-02-15 v1 人工智能
摘要
演示常用于加速深度强化学习算法的学习过程。为应对获取多个演示的困难,一些算法已开发用于从单个演示中学习。特别是,Divide & Conquer Imitation Learning (DCIL) 算法利用顺序偏置,使用单个基于状态的演示学习复杂机器人任务的控制策略。最新版本 DCIL-II 展示了显著的样本效率。该方法 operates within an extended Goal-Conditioned Reinforcement Learning framework,确保来自演示提取的中间目标与后续目标之间的兼容性。然而,一个根本性限制源于假设系统可以重置到演示轨迹上的特定状态,这将其应用限制在模拟系统内。在此基础上,我们引入一种扩展称为 Single-Reset DCIL (SR-DCIL) 的方法,旨�通过依赖单个初始状态重置而非顺序重置来克服这一约束。为解决这一更具挑战性的设置,我们整合了两个机制,源自 Learning from Demonstrations 文献,包括 Demo-Buffer 和 Value Cloning,以引导代理人前往兼容的成功状态。此外,我们引入 Approximate Goal Switching 以促进训练到达离开重置状态较远的目标。我们的论文作出了多个贡献,突出了 DCIL-II 中重置假设的重要性,呈现了 SR-DCIL 变体的机制,并评估了其在具有挑战性的机器人任务中的性能。总之,本工作提供了关于 DCIL 框架中重置假设重要性的见解,并提出 SR-DCIL,作为一种能够在较弱重置假设下学习控制策略的通用算法的第一步。
引用
@article{arxiv.2402.09355,
title = {Single-Reset Divide & Conquer Imitation Learning},
author = {Alexandre Chenu and Olivier Serris and Olivier Sigaud and Nicolas Perrin-Gilbert},
journal= {arXiv preprint arXiv:2402.09355},
year = {2024}
}