一致性模型作为强化学习中一类丰富且高效的策略
机器学习
2024-03-18 v2
摘要
基于分数的生成模型如扩散模型已被证实在从图像生成到强化学习(RL)的多模态数据建模中有效。然而,扩散模型的推理过程可能较慢,这阻碍了其在需迭代采样的 RL 中的使用。我们提出将一致性模型作为一种高效且具表现力的策略表示,即一致性策略,配合 actor-critic 风格的算法用于三种典型 RL 设定:离线、离线到在线与在线。对于离线 RL,我们展示了生成模型作为策略处理多模态数据的表现力。对于离线到在线 RL,一致性策略被证明比扩散策略计算更高效,且性能相当。对于在线 RL,一致性策略展现出相比扩散策略显著的加速甚至更高的平均性能。
引用
@article{arxiv.2309.16984,
title = {Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning},
author = {Zihan Ding and Chi Jin},
journal= {arXiv preprint arXiv:2309.16984},
year = {2024}
}
备注
published as a paper in ICLR 2024