HarmonyDream:世界模型内部的任务协调
机器学习
2024-06-06 v3
摘要
基于模型的强化学习(MBRL)通过利用世界模型有望实现样本高效学习,世界模型刻画了环境的工作方式,通常包含观察建模与奖励建模两个任务组件。本文通过专门的实证调研,深入理解了各任务在世界模型中的作用,并揭示了通过缓解观察或奖励建模任一方的主导地位来释放被忽视的样本高效MBRL潜力。我们的核心洞见是:尽管显式MBRL的主流方法试图通过观察模型恢复环境的丰富细节,但由于环境复杂性与模型容量有限,这难以实现;另一方面,奖励模型虽在隐式MBRL中占主导且善于学习紧凑的以任务为中心的动力系统,但缺乏更丰富的学习信号时不足以支持样本高效学习。受这些洞见与发现的启发,我们提出一种简单而有效的方法HarmonyDream,它自动调整损失系数以维持任务协调,即世界模型学习中两任务间的动态平衡。实验表明,搭载HarmonyDream的基础MBRL方法在视觉机器人任务上获得10%–69%的绝对性能提升,并在Atari 100K基准上创下新的SOTA结果。代码见 https://github.com/thuml/HarmonyDream。
引用
@article{arxiv.2310.00344,
title = {HarmonyDream: Task Harmonization Inside World Models},
author = {Haoyu Ma and Jialong Wu and Ningya Feng and Chenjun Xiao and Dong Li and Jianye Hao and Jianmin Wang and Mingsheng Long},
journal= {arXiv preprint arXiv:2310.00344},
year = {2024}
}
备注
ICML 2024. Code is available at https://github.com/thuml/HarmonyDream