中文

组合强化学习的范畴语义

人工智能 2025-09-09 v3 计算机科学中的逻辑 系统与控制 系统与控制 范畴论

摘要

强化学习(RL)中的组合知识表示有助于实现模块化、可解释且安全的任务规范。然而,生成组合模型需要刻画组合性特征鲁棒性的最小假设,尤其在函数分解的情况下。利用范畴论视角,我们为 RL 的组合理论开发了一个知识表示框架。我们的方法依赖于对范畴 MDP 的理论研究,该范畴的对象是作为任务模型的马尔可夫决策过程(MDPs)。范畴语义通过类似于拼合拼图的推出(pushout)操作来建模任务的组合性。作为这些推出操作的实际应用,我们引入了之字形图(zig-zag diagrams),其依赖于范畴 MDP 所产生的组合性保证。我们进一步证明,范畴 MDP 的性质统一了诸如强制安全要求和利用对称性等概念,推广了先前针对 RL 的抽象理论。

关键词

引用

@article{arxiv.2208.13687,
  title  = {Categorical semantics of compositional reinforcement learning},
  author = {Georgios Bakirtzis and Michail Savvas and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2208.13687},
  year   = {2025}
}