离散码本世界模型用于连续控制
机器学习
2025-03-04 v1
摘要
在强化学习 (RL) 中,世界模型作为内部模拟器,使智能体能够预测环境动力学和未来结果,以作出明智的决策。虽然利用离散潜在空间的方法,如 DreamerV3,在离散动作设置和视觉控制任务中已显示出强大的性能,但其在基于状态的连续控制中的比较性能仍未得到充分探索。相比之下,采用连续潜在空间的方法,如 TD-MPC2,在基于状态的连续控制基准测试中表现突出。本文我们证明,对连续控制而言,建模离散潜在状态具有优势,离散码本编码比替代编码(如 one-hot 和基于标签的编码)更有效。基于这些见解,我们引入了 DCWM:离散码本世界模型,一种基于离散和随机潜在空间的自监督世界模型,其中潜在状态来自码本。我们将 DCWM 与决策时间规划结合,得到我们的模型基 RL 算法,称为 DC-MPC:离散码本模型预测控制,该算法在连续控制基准测试中与最新 SOTA 算法(包括 TD-MPC2 和 DreamerV3)相称。参见我们的项目网站 www.aidanscannell.com/dcmpc。
引用
@article{arxiv.2503.00653,
title = {Discrete Codebook World Models for Continuous Control},
author = {Aidan Scannell and Mohammadreza Nakhaei and Kalle Kujanpää and Yi Zhao and Kevin Sebastian Luck and Arno Solin and Joni Pajarinen},
journal= {arXiv preprint arXiv:2503.00653},
year = {2025}
}
备注
38 pages, 21 figures, published in The Thirteenth International Conference on Learning Representations, ICLR 2025