梦见多世界:学习上下文世界模型助力零样本泛化
机器学习
2024-08-06 v2 人工智能
摘要
对未见动力学的零样本泛化(ZSG)是创造通用能力具身智能体的重大挑战。为了应对这一更广泛的挑战,我们从上下文强化学习(cRL)这一更简单的设定出发,假设可观测参数化系统动力学变化的上下文值(如机器人的质量或尺寸),而不对 Markov 状态的可观测性做进一步简化假设。为了实现针对未见上下文变化的 ZSG 目标,我们提出了上下文循环状态空间模型(cRSSM),对 Dreamer (v3) (Hafner et al., 2023) 的世界模型进行了修改。这使得世界模型能够结合上下文从观测中推断隐 Markov 状态并对隐动力学进行建模。我们的方法在 CARL 基准套件中为研究上下文 RL 而定制的两个任务上进行了评估。实验表明,这种系统性地结合上下文的方法提升了在世界模型“梦境”中训练的策略的 ZSG 能力。我们进一步定性地发现,该方法使 Dreamer 能够将隐状态与上下文解耦,从而将其梦境外推至未见上下文的多个世界。所有实验的代码可在 https://github.com/sai-prasanna/dreaming_of_many_worlds 获取。
引用
@article{arxiv.2403.10967,
title = {Dreaming of Many Worlds: Learning Contextual World Models Aids Zero-Shot Generalization},
author = {Sai Prasanna and Karim Farid and Raghu Rajan and André Biedenkapp},
journal= {arXiv preprint arXiv:2403.10967},
year = {2024}
}
备注
In Reinforcement Learning Conference, 2024. 33 pages