中文

可配置树图(CT-graph):面向终身强化学习中部分可观测与远端奖励环境的可度量问题

机器学习 2023-02-23 v1 人工智能

摘要

本文引入一组形式化定义且透明的问题,用于具有以下特征的强化学习算法:(1) 可变的可观测度(非马尔可夫观测),(2) 远端且稀疏的奖励,(3) 可变且分层的奖励结构,(4) 多任务生成,(5) 可变的问题复杂度。该环境提供一维或二维类别观测,并将动作作为输入。CT-graph 的核心结构是一个具有任意分支因子、深度和观测集的多分支树图,可变化以可控且可度量的方式增加问题维度。设计了决策状态与等待状态两类主要状态,以在观测间创建重要性层级,这正是真实世界问题的典型特征。大型观测集可产生海量历史,损害记忆增强型智能体。可变奖励函数便于轻松创建多任务,并赋予智能体在呈现可控相似度任务的动态场景中高效适应的能力。由于图的指数级增长,可轻松达成具有挑战的复杂度级别。该问题形式化及配套代码提供了一组快速、透明且数学定义的可配置测试,用以比较强化学习算法的性能,尤其在终身学习设定中。

关键词

引用

@article{arxiv.2302.10887,
  title  = {The configurable tree graph (CT-graph): measurable problems in partially observable and distal reward environments for lifelong reinforcement learning},
  author = {Andrea Soltoggio and Eseoghene Ben-Iwhiwhu and Christos Peridis and Pawel Ladosz and Jeffery Dick and Praveen K. Pilly and Soheil Kolouri},
  journal= {arXiv preprint arXiv:2302.10887},
  year   = {2023}
}