基于模型的强化学习中尊重奖励的子任务
机器学习
2023-09-19 v4 人工智能
摘要
为实现人工智能的宏大目标,强化学习必须包含基于世界模型的、在状态与时间上均抽象的规划。深度学习在状态抽象上已取得进展,但尽管基于选项 (options) 框架的理论已充分发展,时间抽象却很少被使用。原因之一在于可能选项的空间极为庞大,且先前提出的选项发现方法未考虑选项模型将如何用于规划。选项通常通过提出辅助任务来发现,例如到达瓶颈状态或最大化除奖励外某感官信号的累积和。每个子任务被求解以产生一个选项,然后学习该选项的模型并提供给规划过程。在多数先前工作中,子任务忽略了原始问题的奖励,而我们提出利用原始奖励加上基于选项终止时状态特征的额外奖励的子任务。我们表明,由此类尊重奖励的子任务获得的选项模型,比特征选项 (eigenoptions)、基于瓶颈状态的最短路径选项或选项批评者 (option-critic) 生成的尊重奖励的选项更有可能在规划中有用。尊重奖励的子任务强烈约束了选项空间,从而也为选项发现问题提供了部分解决方案。最后,我们展示了如何借助标准算法与一般值函数在线、离策略地同时学习值函数、策略、选项与模型。
引用
@article{arxiv.2202.03466,
title = {Reward-Respecting Subtasks for Model-Based Reinforcement Learning},
author = {Richard S. Sutton and Marlos C. Machado and G. Zacharias Holland and David Szepesvari and Finbarr Timbers and Brian Tanner and Adam White},
journal= {arXiv preprint arXiv:2202.03466},
year = {2023}
}