OLLIE:从离线预训练到在线微调的模仿学习
机器学习
2024-05-31 v3 人工智能
摘要
本文研究离线到在线的模仿学习(Imitation Learning, IL),即从静态演示数据中预训练模仿策略,随后通过最少的环境交互进行快速微调。我们发现现有离线 IL 和在线 IL 方法的简单组合在此场景下往往表现不佳,因为初始判别器(常用于在线 IL)随机运行且与策略初始化不一致,导致策略优化被误导并预训练知识。为克服这一挑战,我们提出了一种原则性的离线到在线 IL 方法,名为 ,该方法同时学习近专家策略初始化和,可无缝集成到在线 IL 中,实现平滑且快速的微调。实验表明,在从连续控制到视觉领域的 项具有挑战性的任务中, 在性能、演示效率和收敛速度方面均持续且显著优于基线方法。这项工作可作为在 IL 背景下进一步探索预训练和微调的基础。
引用
@article{arxiv.2405.17477,
title = {OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning},
author = {Sheng Yue and Xingyuan Hua and Ju Ren and Sen Lin and Junshan Zhang and Yaoxue Zhang},
journal= {arXiv preprint arXiv:2405.17477},
year = {2024}
}
备注
International Conference on Machine Learning (ICML)