为强化学习构建最小且可重用的因果状态抽象
人工智能
2025-08-19 v1 机器学习
机器人学
摘要
强化学习(RL)算法的两个期望是能够从相对较少的经验中学习,以及能够学习泛化到一系列问题规范的策略。在因子化状态空间中,实现这两个目标的一种方法是学习状态抽象,它只保留学习当前任务所需的必要变量。本文介绍了因果对偶模拟建模(CBM),一种学习动力学和奖励函数中的因果关系以推导出最小、任务特定抽象的方法。CBM利用并改进隐式建模来训练一个高保真因果动力学模型,该模型可以重复用于同一环境中的所有任务。在操作环境和Deepmind Control Suite上的实证验证表明,CBM学习的隐式动力学模型比显式模型更准确地识别了潜在的因果关系和状态抽象。此外,导出的状态抽象使任务学习器能够达到接近神谕的样本效率,并在所有任务上优于基线。
引用
@article{arxiv.2401.12497,
title = {Building Minimal and Reusable Causal State Abstractions for Reinforcement Learning},
author = {Zizhao Wang and Caroline Wang and Xuesu Xiao and Yuke Zhu and Peter Stone},
journal= {arXiv preprint arXiv:2401.12497},
year = {2025}
}
备注
Accepted at AAAI24