IN-RIL: 交叉式强化学习与模仿学习用于策略微调
机器人学
2025-05-16 v1 人工智能
摘要
模仿学习 (IL) 和强化学习 (RL) 各自为机器人策略学习提供了不同优势: IL 提供了从演示中获得稳定学习的能力, RL 通过探索促进了泛化。虽然现有的机器人学习方法使用 IL-based 预训练后跟 RL-based 微调具有前景, 但这种两步学习范式在 RL 微调阶段常常 suffers from 不稳定性和差样本效率。在本工作中, 我们引入 IN-RIL, INterleaved Reinforcement learning and Imitation Learning, 用于策略微调, 通过在多个 RL 更新后定期注入 IL 更新来实现, 从而能够从 IL 的稳定性和专家数据对更高效探索的指导中受益。由于 IL 和 RL 涉及不同的优化目标, 我们发展了梯度分离机制以防止 \ABBR 微调期间的破坏性干扰, 通过在正交子空间中分离可能存在冲突的梯度更新。此外, 我们进行了严格分析, 我们的发现阐明了为何在 IL 与 RL 交叉可稳定学习并提高样本效率。广泛的实验在 14 个机器人操控和运动任务上进行, 包括 FurnitureBench、OpenAI Gym 和 Robomimic 三个基准, 表明 \ABBR 能显著提高样本效率并缓解在线 finetuning 中长期和短期任务中稀疏或稠密奖励下的性能崩溃。IN-RIL 作为一种通用可与各种最新 RL 算法兼容的插件, 能显著提高 RL 微调效果, 例如在 Robomimic Transport 上从 12% 提升到 88%, 实现 6.3 倍成功率提升。项目页面: https://github.com/ucd-dare/IN-RIL.
引用
@article{arxiv.2505.10442,
title = {IN-RIL: Interleaved Reinforcement and Imitation Learning for Policy Fine-Tuning},
author = {Dechen Gao and Hang Wang and Hanchu Zhou and Nejib Ammar and Shatadal Mishra and Ahmadreza Moradipari and Iman Soltani and Junshan Zhang},
journal= {arXiv preprint arXiv:2505.10442},
year = {2025}
}