中文

模型不匹配下的协作价值函数估计:联邦时序差分分析

机器学习 2025-06-17 v2

摘要

联邦强化学习(FedRL)通过防止代理之间直接数据交换来实现协作学习,同时保留数据隐私。然而,许多现有FedRL算法假设所有代理在相同的环境中运行,这往往不现实。在实际应用中,如多机器人团队、众包系统和大规模传感器网络中,每个代理可能经历略微不同的转移动力学,导致固有的模型不匹配。在本文中,我们首先在策略评估中建立单代理时序差分学习(TD(0))的线性收敛保证,并演示在扰动环境下,代理会遭受系统性偏差,阻止准确估计真实价值函数。该结果在i.i.d.和Markovian抽样 regime下均成立。我们随后将分析扩展到联邦TD(0)(FedTD(0))设置,即多个代理各自与各自的扰动环境交互,定期共享价值估计以协作近似共同底层模型的真实价值函数。我们的理论结果表明,模型不匹配、网络连通性和混合行为对FedTD(0)的收敛具有影响。实验结果证实了我们的理论优势,突出了即使在适度的信息共享下,显著减轻了环境特定的误差。

关键词

引用

@article{arxiv.2503.17454,
  title  = {Collaborative Value Function Estimation Under Model Mismatch: A Federated Temporal Difference Analysis},
  author = {Ali Beikmohammadi and Sarit Khirirat and Peter Richtárik and Sindri Magnússon},
  journal= {arXiv preprint arXiv:2503.17454},
  year   = {2025}
}