面向任务无关状态抽象的因果动力学学习
机器学习
2022-06-28 v1
摘要
准确学习动力学模型是基于模型的强化学习(MBRL)的一个重要目标,但大多数 MBRL 方法学习的是稠密动力学模型,易受虚假相关性影响,因而对未见状态的泛化能力较差。本文提出面向任务无关状态抽象的因果动力学学习(CDL),它首先学习一个经理论证明的因果动力学模型,该模型去除了状态变量与动作间不必要的依赖,从而对未见状态具有良好的泛化能力。随后可从所学动力学中导出状态抽象,其不仅提升样本效率,而且比现有状态抽象方法适用于更广的任务范围。在两个模拟环境及下游任务上的评估表明,该方法所学的动力学模型与策略对未见状态均泛化良好,且导出的状态抽象相比无抽象学习提升了样本效率。
引用
@article{arxiv.2206.13452,
title = {Causal Dynamics Learning for Task-Independent State Abstraction},
author = {Zizhao Wang and Xuesu Xiao and Zifan Xu and Yuke Zhu and Peter Stone},
journal= {arXiv preprint arXiv:2206.13452},
year = {2022}
}
备注
International Conference on Machine Learning 2022 (ICML)