基于联合线性逼近的个人化多智能体平均奖励 TD 学习
机器学习
2026-03-10 v2
摘要
我们研究个人化多智能体平均奖励 TD 学习,其中一组智能体与不同环境交互并联合学习各自的值函数。我们关注存在共享线性表示的情形,即智能体的最优权重整体地位于未知线性子空间中。受个人化联邦学习(PFL)近期成功的启发,我们研究合作单时间尺度 TD 学习,其中的智能体迭代地估计公共子空间和局部头部。我们证明,该分解可以过滤掉冲突信号,有效缓解“不对齐”信号的负面影响,实现线性加速。主要技术挑战在于异构性、马尔可夫采样以及它们在塑造误差演化中的复杂相互作用。具体而言,不仅是多个变量的误差动力学彼此紧密相连,而且该optimal子空间与estimated子空间之间主角距离也不存在直接的收敛。我们希望我们的分析技术对激发更深入地利用公共结构的研究有所帮助。实验表明,通过共享结构学习对更一般的控制问题具有益处。
引用
@article{arxiv.2603.02426,
title = {Personalized Multi-Agent Average Reward TD-Learning via Joint Linear Approximation},
author = {Leo Muxing Wang and Pengkun Yang and Lili Su},
journal= {arXiv preprint arXiv:2603.02426},
year = {2026}
}