中文

时间扩展的后继表示

机器学习 2022-09-27 v1 人工智能

摘要

我们提出后继表示的一种时间扩展变体,称之为 t-SR。t-SR 通过在基本动作重复上构建后继表示,捕获时间扩展动作的期望状态转移动态。这种时间抽象不学习自上而下的相关任务结构层次,而是学习耦合动作与动作重复的自下而上组合。这减少了控制中所需的决策数量,而无需学习分层策略。因此,t-SR 直接考虑时间扩展动作序列的时间范围,无需预定义或领域特定的选项。我们表明,在具有动态奖励结构的环境中,t-SR 能够同时利用后继表示的灵活性与时间扩展动作所提供的抽象。因而,在一系列稀疏奖励的网格世界环境中,t-SR 比可比的基于值、无模型强化学习方法最优地适应所学策略要快得多。我们还表明,t-SR 学习解决这些任务的方式要求所学策略的采样频率一致地低于非时间扩展策略。

关键词

引用

@article{arxiv.2209.12331,
  title  = {Temporally Extended Successor Representations},
  author = {Matthew J. Sargent and Peter J. Bentley and Caswell Barry and William de Cothi},
  journal= {arXiv preprint arXiv:2209.12331},
  year   = {2022}
}

备注

Presented at the 5th Multi-Disciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2022