分布式强化学习中用于值迭代的非参数 Bellman 映射
机器学习
2025-10-09 v2 信号处理
摘要
本文引入了用于分布式强化学习(DRL)中值迭代(VI)的新型 Bellman 映射(B-Maps),其中智能体部署在具有任意拓扑结构的无向连通图/网络上,但没有中心化节点,即能够聚合所有数据并执行计算的节点。每个智能体根据其私有数据构建非参数 B-Map,在再生核 Hilbert 空间中表示的 Q 函数上运行,并具有选择其表示基的灵活性。智能体仅与直接邻居交换其 Q 函数估计,且不同于将通信限制为 Q 函数的现有 DRL 方法,所提出的框架还支持以协方差矩阵的形式传输基信息,从而传达额外的结构细节。无论网络拓扑如何,Q 函数和协方差矩阵估计均向其共识值建立了线性收敛速率,最优学习率由图拉普拉斯矩阵的最小正特征值(图的 Fiedler 值)与最大特征值之比确定。详细的性能分析进一步表明,如果存在中心化节点,所提出的 DRL 框架能有效近似该中心化节点的性能。在两个基准控制问题上的数值测试证实了所提出的非参数 B-Maps 相对于先前方法的有效性。值得注意的是,测试揭示了一个有悖直觉的结果:尽管该框架涉及更丰富的信息交换——具体而言是通过传输协方差矩阵作为基信息——但它实现预期性能的累积通信成本低于现有 DRL 方案,这凸显了共享基信息在加速学习过程中的关键作用。
引用
@article{arxiv.2503.16192,
title = {Nonparametric Bellman Mappings for Value Iteration in Distributed Reinforcement Learning},
author = {Yuki Akiyama and Konstantinos Slavakis},
journal= {arXiv preprint arXiv:2503.16192},
year = {2025}
}