基于后继表示的强化学习中的时间抽象
机器学习
2023-04-13 v3 人工智能
摘要
在多个时间抽象层级上进行推理是智能的关键属性之一。在强化学习中,这常通过称为选项 (options) 的时间扩展动作过程来建模。选项使智能体能够在环境中以不同抽象层级进行预测与操作。然而,基于选项框架的方法往往一开始就假定已知一组合理的选项。当并非如此时,对于应考虑哪些选项并没有确定答案。本文中,我们论证后继表示 (SR)——其基于跟随各状态的状态访问模式来编码状态——可视为发现与使用时间抽象的自然基底。为支持该主张,我们宏观审视近期结果,展示 SR 如何用于发现促进时间扩展探索或规划的选项。我们将这些结果阐释为一个通用选项发现框架的实例,其中智能体的表示用于识别有用选项,而这些选项又被用来进一步改进其表示。这形成了一个良性、永无止境的循环:表示与选项基于彼此不断精炼。除选项发现本身外,我们还讨论 SR 如何使我们能将一组选项扩充为组合爆炸式的对应集合而无需额外学习。这通过组合先前学到的选项实现。我们的实证评估聚焦于为探索所发现的选项,以及利用 SR 组合它们。实验结果揭示了选项定义中的重要设计决策,并展示了基于 SR 的不同方法(如特征选项与选项键盘)之间的协同。
引用
@article{arxiv.2110.05740,
title = {Temporal Abstraction in Reinforcement Learning with the Successor Representation},
author = {Marlos C. Machado and Andre Barreto and Doina Precup and Michael Bowling},
journal= {arXiv preprint arXiv:2110.05740},
year = {2023}
}
备注
This is the final, published JMLR version