中文

广义强化学习:经验粒子、动作算子、强化场、记忆关联与决策概念

机器学习 2022-08-31 v2 人工智能

摘要

学习能够适应时变且可能演化的系统动态的控制策略一直是主流强化学习(RL)的一大挑战。主要地,不断变化的系统属性会持续影响 RL 智能体通过其动作与状态空间的交互方式,从而有效地将概念漂移(重新)引入底层策略学习过程。我们假定,通过以额外的“自由度”刻画和表示动作,并由此以更大灵活性适应动作“行为”结果的变化(包括这些动作如何实时执行以及动作集本身的偏移),可实现控制策略更高的适应性。本文提出一种具贝叶斯风格的广义 RL 框架:首先建立参数化动作模型的概念以更好应对不确定性与流动的动作行为,随后引入强化场的概念,作为一种受物理启发的构造,通过维持在 RL 智能体工作记忆中的“极化经验粒子”建立。这些粒子有效编码了智能体随时间以自组织方式演化的动态学习经验。以强化场为基础,我们将进一步推广策略搜索,通过视过往记忆为隐式图结构来纳入高层决策概念,其中记忆实例或粒子以其可关联性/相似性定义并量化而相互连接,从而可一致地应用“联想记忆”原理来建立并增强学习智能体演化的世界模型。

关键词

引用

@article{arxiv.2208.04822,
  title  = {Generalized Reinforcement Learning: Experience Particles, Action Operator, Reinforcement Field, Memory Association, and Decision Concepts},
  author = {Po-Hsiang Chiu and Manfred Huber},
  journal= {arXiv preprint arXiv:2208.04822},
  year   = {2022}
}

备注

37 pages, 15 figures