来自多样化辅助数据的鲁棒离线模仿学习
机器学习
2025-05-23 v3
摘要
离线模仿学习仅从一组专家演示中学习策略,而无需与环境交互。为缓解由于专家数据有限导致的分布迁移问题,近期研究将大量辅助演示与专家数据并行引入。然而,这些方法的性能依赖于对辅助数据质量与构成的假设,当这些假设不成立时往往难以取得好结果。为此,我们提出了鲁棒的多样化辅助数据离线模仿学习框架(ROIDA)。ROIDA首先通过学习的奖励函数从整个辅助数据集中识别高质量的转移,这些高奖励样本与专家演示组合进行加权行为克隆。对于低质量样本,ROIDA应用时序差分学习,将策略引导至高奖励状态,以提高长期回报。这种以两个层面方式处理数据的方法,使我们能够在无需任何假设的情况下有效利用高质量和低质量数据。大量实验表明,ROIDA在多种辅助数据集上实现稳健且一致的性能,有效利用了未标记的辅助数据,超越了依赖特定数据假设的先前方法。我们的代码已公开:https://github.com/uditaghosh/roida。
引用
@article{arxiv.2410.03626,
title = {Robust Offline Imitation Learning from Diverse Auxiliary Data},
author = {Udita Ghosh and Dripta S. Raychaudhuri and Jiachen Li and Konstantinos Karydis and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2410.03626},
year = {2025}
}
备注
Accepted at TMLR