中文

基于最优判别器加权的模仿视角下的强化学习

机器学习 2025-04-21 v1 人工智能

摘要

我们提出了迭代双模强化学习(IDRL),一种基于最优判别器加权模仿视角解决强化学习的方法。我们的 method 源于一种简单实验:我们发现使用离线数据集加上额外的专家数据集训练判别器,然后进行判别器加权行为模仿,在各种类型的数据集上都取得了强烈的结果。我们发现,这种最优判别器权重与Dual-RL中学习到的访问分布比率相当,但我们发现当前的Dual-RL方法未能正确估计该比率。在IDRL中,我们提出了一种纠正方法,以迭代方式逼近离线数据集中最优访问分布比率(无需额外的专家数据集)。在每个迭代过程中,IDRL使用来自前一个迭代中学习到的比率删除零权重次优转移,并在剩余子数据集上运行Dual-RL。这可以看作是用前一个迭代中优化后的访问分布替换行为访问分布,这理论上提供了一个逐步接近最优判别器权重的课程改进后的访问分布比率。我们在各种类型的离线数据集上验证了IDRL的有效性,包括D4RL数据集和更真实的受损示范。IDRL在性能和稳定性方面均优于强大的 primal-RL和Dual-RL基线,适用于所有数据集。

关键词

引用

@article{arxiv.2504.13368,
  title  = {An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning},
  author = {Haoran Xu and Shuozhe Li and Harshit Sikchi and Scott Niekum and Amy Zhang},
  journal= {arXiv preprint arXiv:2504.13368},
  year   = {2025}
}

备注

ICLR 2025