中文

强化学习中的表示与不变性

人工智能 2023-02-14 v3 计算机科学与博弈论 机器学习

摘要

研究者以不同方式形式化了强化学习(RL)。若一个RL框架中的智能体要在另一RL框架的环境中运行,该智能体必须首先被转换或映射进那一框架。这是否可能不仅取决于所涉RL框架,还取决于智能本身如何度量。本文为研究RL框架间保持相对智能的可映射性奠定基础。我们定义了RL框架间的两类映射,称为弱翻译与强翻译,并证明这些映射的存在性依映射保持相对智能实现了两类智能比较。我们考察了以下两者之间这些映射的存在与否:(i) 智能体先行的RL框架与环境先行的RL框架;以及(ii) 十二种因智能体或环境是否被要求为确定性而不同的RL框架。在前一情形,我们考虑智能体先行与环境先行RL间及反之的多种自然映射;我们给出一些正面结果(部分此类映射为强或弱翻译)与一些负面结果(部分不是)。在后一情形,在整数值奖励及一些额外温和假设下,我们完整刻画了十二个RL框架对中有哪些承认弱翻译。

关键词

引用

@article{arxiv.2112.07752,
  title  = {Representation and Invariance in Reinforcement Learning},
  author = {Samuel Alexander and Arthur Paul Pedersen},
  journal= {arXiv preprint arXiv:2112.07752},
  year   = {2023}
}

备注

25 pages, 1 figure