不要从零开始:基于插值的策略扩散实现行为精炼
机器学习
2024-07-12 v4 人工智能
机器人学
摘要
模仿学习通过从示范中学习使智能体能够模仿行为。最近,具有建模高维和多模态分布能力的扩散模型在模仿学习任务上展示了令人印象深刻的性能。这些模型通过从标准高斯噪声中扩散动作(或状态)来学习塑造策略。然而,要学习的目标策略通常与高斯分布显著不同,这种不匹配在使用少量扩散步骤(以提高推理速度)和数据有限的情况下可能导致性能不佳。本文的关键思想是,从比高斯分布更具信息性的源分布出发,可以使扩散方法缓解上述限制。我们贡献了理论结果、新方法和实证发现,展示了使用信息性源策略的好处。我们的方法称为BRIDGER,利用随机插值框架桥接任意策略,从而实现了灵活的模仿学习方法。它推广了先前的工作,因为仍然可以应用标准高斯分布,但如果可用,也可以使用其他源策略。在具有挑战性的模拟基准测试和真实机器人上的实验中,BRIDGER优于最先进的扩散策略。我们进一步分析了应用BRIDGER时的设计考虑。BRIDGER的代码可在https://github.com/clear-nus/bridger获取。
引用
@article{arxiv.2402.16075,
title = {Don't Start from Scratch: Behavioral Refinement via Interpolant-based Policy Diffusion},
author = {Kaiqi Chen and Eugene Lim and Kelvin Lin and Yiyang Chen and Harold Soh},
journal= {arXiv preprint arXiv:2402.16075},
year = {2024}
}