扩散状态与匹配得分:一种用于模仿学习的新框架
机器学习
2025-03-04 v2
摘要
对抗式模仿学习传统上被视为学习者与 adversarially chosen 成本函数之间的两人零和博弈,可因此被理解为生成对抗网络(GAN)的序列化推广。然而,近年来,扩散模型作为 GAN 的非对抗替代方案已涌现,仅需通过回归训练评分函数即可生成质量更高的样本。为响应这一趋势,我们调查如何将扩散建模的见解提升到序列设置中。我们提出通过对扩散后的状态进行扩散并执行得分匹配,以衡量专家状态与学习者状态之间的差异。因此,我们的方法仅需训练预测噪声的评分函数,即可通过标准回归实现,这使得训练显著比对抗方法更容易且更稳定。理论上,我们证明了具有线性时间尺度的一阶和二阶实例相关界,表明该方法避免了离线模仿学习中常见的误差累积。实验上,我们在各种连续控制问题上展示了该方法的优越性,包括控制人类机器人行走、坐下、爬行以及穿越障碍物等复杂任务。
引用
@article{arxiv.2410.13855,
title = {Diffusing States and Matching Scores: A New Framework for Imitation Learning},
author = {Runzhe Wu and Yiding Chen and Gokul Swamy and Kianté Brantley and Wen Sun},
journal= {arXiv preprint arXiv:2410.13855},
year = {2025}
}
备注
Accepted at ICLR 2025