中文

一致性模型作为强化学习中一类丰富且高效的策略

机器学习 2024-03-18 v2

摘要

基于分数的生成模型如扩散模型已被证实在从图像生成到强化学习(RL)的多模态数据建模中有效。然而,扩散模型的推理过程可能较慢,这阻碍了其在需迭代采样的 RL 中的使用。我们提出将一致性模型作为一种高效且具表现力的策略表示,即一致性策略,配合 actor-critic 风格的算法用于三种典型 RL 设定:离线、离线到在线与在线。对于离线 RL,我们展示了生成模型作为策略处理多模态数据的表现力。对于离线到在线 RL,一致性策略被证明比扩散策略计算更高效,且性能相当。对于在线 RL,一致性策略展现出相比扩散策略显著的加速甚至更高的平均性能。

关键词

引用

@article{arxiv.2309.16984,
  title  = {Consistency Models as a Rich and Efficient Policy Class for Reinforcement Learning},
  author = {Zihan Ding and Chi Jin},
  journal= {arXiv preprint arXiv:2309.16984},
  year   = {2024}
}

备注

published as a paper in ICLR 2024