中文

OLLIE:从离线预训练到在线微调的模仿学习

机器学习 2024-05-31 v3 人工智能

摘要

本文研究离线到在线的模仿学习(Imitation Learning, IL),即从静态演示数据中预训练模仿策略,随后通过最少的环境交互进行快速微调。我们发现现有离线 IL 和在线 IL 方法的简单组合在此场景下往往表现不佳,因为初始判别器(常用于在线 IL)随机运行且与策略初始化不一致,导致策略优化被误导并遗忘\textit{遗忘}预训练知识。为克服这一挑战,我们提出了一种原则性的离线到在线 IL 方法,名为 OLLIE\texttt{OLLIE},该方法同时学习近专家策略初始化和对齐的判别器初始化\textit{对齐的判别器初始化},可无缝集成到在线 IL 中,实现平滑且快速的微调。实验表明,在从连续控制到视觉领域的 20\textbf{20} 项具有挑战性的任务中,OLLIE\texttt{OLLIE} 在性能、演示效率和收敛速度方面均持续且显著优于基线方法。这项工作可作为在 IL 背景下进一步探索预训练和微调的基础。

关键词

引用

@article{arxiv.2405.17477,
  title  = {OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning},
  author = {Sheng Yue and Xingyuan Hua and Ju Ren and Sen Lin and Junshan Zhang and Yaoxue Zhang},
  journal= {arXiv preprint arXiv:2405.17477},
  year   = {2024}
}

备注

International Conference on Machine Learning (ICML)