终身强化学习中可扩展且鲁棒规划的最小值等价部分模型
机器学习
2023-06-13 v2 人工智能
摘要
从纯交互中学习环境模型通常被认为是构建终身强化学习智能体的关键组成部分。然而,基于模型的强化学习的常见做法是学习对环境各个方面都进行建模的模型,而不管这些方面对于得出最优决策是否重要。在本文中,我们认为此类模型并不特别适合在终身强化学习场景中执行可扩展且鲁棒的规划,并提出了仅对环境相关方面进行建模的新型模型,我们称之为“最小值等价部分模型”。在给出这些模型的正式定义后,我们提供了理论结果以证明使用此类模型进行规划的可扩展性优势,随后进行实验以经验性地说明我们的理论结果。然后,我们提供了一些关于如何使用深度学习架构学习此类模型的有用启发式方法,并经验性地证明以这种方式学习的模型能够支持执行对分布偏移和模型误差累积具有鲁棒性的规划。总体而言,我们的理论和经验结果均表明,最小值等价部分模型可为在终身强化学习场景中执行可扩展且鲁棒的规划带来显著益处。
引用
@article{arxiv.2301.10119,
title = {Minimal Value-Equivalent Partial Models for Scalable and Robust Planning in Lifelong Reinforcement Learning},
author = {Safa Alver and Doina Precup},
journal= {arXiv preprint arXiv:2301.10119},
year = {2023}
}
备注
Published as a conference paper at CoLLAs 2023