中文

余代数中的通用强化学习:基于传导的异步随机计算

机器学习 2025-08-22 v1 人工智能

摘要

在本文中,我们引入了一种强化学习(RL)的范畴论推广,称为通用强化学习(URL),它建立在非良基集上的余归纳、通用余代数、拓扑斯理论以及异步并行分布式计算的范畴模型等强大数学抽象之上。在论文的前半部分,我们回顾了基本的 RL 框架,阐述了范畴和函子在 RL 中的使用,展示了它们如何带来有趣的见解。特别地,我们还介绍了 Bertsekas 和 Tsitsiklis 提出的异步分布式最小化的标准模型,并描述了度量余归纳与其异步收敛定理证明之间的关系。MDP 或 PSR 的算法空间可以被建模为一个函子范畴,其中余域范畴形成一个拓扑斯,该拓扑斯允许所有(余)极限,拥有子对象分类器,并具有指数对象。在论文的后半部分,我们转向通用余代数。动态系统模型,如马尔可夫决策过程(MDP)、部分可观测 MDP(POMDP)、预测状态表示(PSR)和线性动态系统(LDS),都是余代数的特殊类型。我们描述了一个广泛的通用余代数族,扩展了先前在 RL 中研究的动态系统模型。RL 中寻找不动点以确定精确或近似(动作)价值函数的核心问题,在 URL 中被推广为以并行分布式方式异步确定最终余代数。

关键词

引用

@article{arxiv.2508.15128,
  title  = {Universal Reinforcement Learning in Coalgebras: Asynchronous Stochastic Computation via Conduction},
  author = {Sridhar Mahadevan},
  journal= {arXiv preprint arXiv:2508.15128},
  year   = {2025}
}

备注

45 pages