基于在线演示的机器人策略迁移:一种主动强化学习方法
机器人学
2025-03-18 v1 人工智能
机器学习
摘要
迁移学习是一种强大的工具,使机器人能够将在不同环境、任务或形态中学习到的策略进行迁移。为了进一步促进这一过程,人们已努力将其与从演示中学习相结合,以实现更灵活、高效的策略迁移。然而,这些方法几乎完全局限于在策略迁移开始前收集的离线演示,这可能受到 LfD 带来的协方差偏移这一固有问题的困扰,并损害策略迁移的性能。同时,从零开始学习设定下的大量工作表明,在线演示可以有效缓解协方差偏移,并通过提高样本效率带来更好的策略性能。本工作结合这些见解,将在线演示引入策略迁移设定。我们提出了“基于在线演示的策略迁移”,这是一种用于策略迁移的主动 LfD 算法,能够在有限的演示预算下优化在线片段式专家演示的查询时机和内容。我们在八个机器人场景中评估了我们的方法,涉及跨不同环境特征、任务目标和机器人形态的策略迁移,旨在将训练好的策略从源任务迁移到相关但不同的目标任务。结果表明,与两种使用离线演示的经典 LfD 方法和一种使用在线演示的主动 LfD 方法相比,我们的方法在平均成功率和样本效率方面均显著优于所有基线。此外,我们还在真实世界环境的三个迁移场景中对迁移策略进行了初步的 sim-to-real 测试,展示了策略在真实机器人操作臂上的有效性。
引用
@article{arxiv.2503.12993,
title = {Robot Policy Transfer with Online Demonstrations: An Active Reinforcement Learning Approach},
author = {Muhan Hou and Koen Hindriks and A. E. Eiben and Kim Baraka},
journal= {arXiv preprint arXiv:2503.12993},
year = {2025}
}