中文

基于对抗密度加权回归的辅助不完美演示学习

机器学习 2025-01-14 v3 人工智能

摘要

我们提出一种新颖的单步骤监督式仿真学习(IL)框架,称为对抗密度回归(Adversarial Density Regression, ADR)。该IL框架旨在通过利用演示纠正在未知质量下学习的策略分布,而无需依赖Bellman算子。具体而言,ADR解决了前述IL算法的若干局限性:首先,大多数IL算法基于Bellman算子,必然在多步骤更新过程中因亚最优奖励而产生累积偏移;其次,基于离策略训练框架则受困于分布外(OOD)状态-动作。其次,保守项虽有助于解决OOD问题,但难以权衡。为此,我们将单步骤密度加权行为克隆(BC)目标充分集成于IL中,并利用辅助不完美演示。理论上,我们证明该适应方法可有效纠正在未知质量数据集上训练的策略分布,使其与专家策略分布一致。此外,ADR目标函数的上界与经验值函数与最优值函数之差成正比,表明最小化ADR目标函数相当于逼近最优值。实验方面,我们通过大量评估验证了ADR的性能。具体而言,ADR在Gym-Mujoidomain中的任务中均优于所选的IL算法;在Adroit和Kitchen domains中利用真实奖励时,ADR相较于IQL实现了89.5%的提升。我们的代码将在https://github.com/stevezhangzA/Adverserial_Density_Regression发布。

关键词

引用

@article{arxiv.2405.20351,
  title  = {Imitating from auxiliary imperfect demonstrations via Adversarial Density Weighted Regression},
  author = {Ziqi Zhang and Zifeng Zhuang and Jingzehua Xu and Yiyuan Yang and Yubo Huang and Donglin Wang and Shuai Zhang},
  journal= {arXiv preprint arXiv:2405.20351},
  year   = {2025}
}