通过扩散学习达到目标
机器学习
2024-10-29 v3 人工智能
摘要
我们提出一种将目标条件强化学习置于去噪扩散模型语境中的新视角。类比扩散过程(其中高斯噪声用于创建远离数据流形的随机轨迹),我们构建远离潜在目标状态的轨迹。随后我们学习一个目标条件策略来逆转这些偏移,类比得分函数。这一称为Merlin的方法可从任意初始状态达到指定目标,而无需学习单独的价值函数。与近期在离线RL中使用扩散模型的工作不同,Merlin是首个在状态空间执行扩散的方法,每个环境步仅需一次“去噪”迭代。我们在多种离线目标到达任务中实验验证该方法,相较最先进方法表现出显著性能提升,同时比其他基于扩散的RL方法计算效率提高一个数量级。我们的结果表明,这一扩散用于RL的视角是一种简单且可扩展的序列决策方法。
引用
@article{arxiv.2310.02505,
title = {Learning to Reach Goals via Diffusion},
author = {Vineet Jain and Siamak Ravanbakhsh},
journal= {arXiv preprint arXiv:2310.02505},
year = {2024}
}