基于商空间的Bellman兼容平均奖励分布式强化学习的商范畴表示
机器学习
2026-05-13 v1 最优化与控制
摘要
平均奖励强化学习需要估计增益和偏置,而后者仅在加法常数上定义。这使得直接的分布式类比在实数轴上难以定义。我们引入一种商空间形式,其中将状态索引的偏置律在共同平移下识别,并伴随一种尊重这种对称性的范畴参数化。在该商范畴空间上,我们定义了一个投影平均奖励分布式算子,并证明其在坐标Cram\'er度量下是 well-defined 的、non-expansive 的,并具有固定点。我们随后研究了其平均值映射为该算子的异步松弛形式的采样递归。在理想的 centered-reward 设置下,单状态时序差分更新在i.i.d.和Markovian抽样下都实现几乎sure收敛,并在有限迭代残差界下表现良好。当增益未知时,我们将递归与在线增益估计器相合并,并证明了所得耦合方案的non-expansiveness和Markovian收敛性。最后,我们表明同步精确更新在商律水平上是增益无关的,这在理想商分布与实际固定网格范畴表示之间隔离了一个结构性差异。
引用
@article{arxiv.2605.11289,
title = {Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning},
author = {Ege C. Kaya and Aliasghar Pourghani and Vijay Gupta and Abolfazl Hashemi},
journal= {arXiv preprint arXiv:2605.11289},
year = {2026}
}
备注
29 pages, 4 figures