SD2AIL:基于扩散模型的对抗性仿照学习中的合成演示
机器学习
2026-04-30 v2 机器人学
摘要
对抗性仿照学习 (AIL) 是仿照学习中的一种主导框架,通过从专家演示中推断奖励来指导策略优化。虽然提供更多的专家演示通常会导致更好的性能和更大的稳定性,但在某些场景下收集此类演示可能具有挑战性。鼓励利用扩散模型在数据生成方面的成功,我们提出了 SD2AIL,该方法利用扩散模型生成合成演示。我们首先在判别器中使用扩散模型生成作为伪专家数据的合成演示,以增强专家演示。为了从大量(伪-)专家演示中选择最有价值的演示,我们进一步引入了优先级专家演示重放策略 (PEDR)。在仿真任务中的实验结果表明,我们的方法在有效性和鲁棒性方面均表现出色。特别是在 Hopper 任务中,我们的方法平均回报达到 3441,超越了最先进的方法 89 分。我们的代码将在 https://github.com/positron-lpc/SD2AIL 上提供。
引用
@article{arxiv.2512.18583,
title = {SD2AIL: Adversarial Imitation Learning from Synthetic Demonstrations via Diffusion Models},
author = {Pengcheng Li and Qiang Fang and Tong Zhao and Yixing Lan and Xin Xu},
journal= {arXiv preprint arXiv:2512.18583},
year = {2026}
}
备注
This paper has the following problems: Limited novelty, not clearly differentiated from existing methods/concepts; The level of experimental validation is limited; Sufficient serious structural, language, or other issues that impact the comprehensibility of the manuscript