中文

Policy Decorator:面向大型策略模型的模型无关在线精化

机器人学 2024-12-19 v1 人工智能 机器学习

摘要

机器人学习的最新进展利用模仿学习与大型模型及大量演示来开发有效策略。然而,这些模型通常受限于演示的数量、质量和多样性。本文探索通过与环境在线交互来改进离线训练的模仿学习模型。我们引入Policy Decorator,它使用模型无关的残差策略在在线交互过程中精化大型模仿学习模型。通过实施受控探索策略,Policy Decorator实现了稳定、样本高效的在线学习。我们的评估涵盖两个基准(ManiSkill和Adroit)上的八个任务,并涉及两种最先进的模仿学习模型(Behavior Transformer和Diffusion Policy)。结果表明,Policy Decorator有效改进了离线训练的策略,并保持了模仿学习模型的平滑运动,避免了纯RL策略的异常行为。视频请参见我们的项目页面(https://policydecorator.github.io)。

关键词

引用

@article{arxiv.2412.13630,
  title  = {Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model},
  author = {Xiu Yuan and Tongzhou Mu and Stone Tao and Yunhao Fang and Mengke Zhang and Hao Su},
  journal= {arXiv preprint arXiv:2412.13630},
  year   = {2024}
}

备注

Explore videos, data, code, and more at https://policydecorator.github.io