中文

异构动力系统的无模型学习:一种联邦 LQR 方法

最优化与控制 2023-08-24 v1

摘要

我们研究一个无模型的联邦线性二次调节器(LQR)问题,其中 MM 个具有未知、不同但相似动力学的智能体协作学习一个最优策略,以最小化平均二次代价,同时保持其数据隐私。为利用智能体动力学的相似性,我们提出使用联邦学习(FL)允许智能体定期与中央服务器通信,通过利用来自所有智能体的更大数据集来训练策略。在此设置下,我们试图理解以下问题:(i)学习到的通用策略对所有智能体是否稳定?(ii)学习到的通用策略与每个智能体自身最优策略的接近程度如何?(iii)每个智能体能否通过利用所有智能体的数据更快地学习其自身最优策略?为回答这些问题,我们提出一种名为 FedLQR 的联邦且无模型的算法。我们的分析克服了众多技术挑战,例如智能体动力学的异构性、多次本地更新以及稳定性问题。我们证明 FedLQR 产生的通用策略在每次迭代时对所有智能体都是稳定的。我们给出了通用策略与每个智能体本地最优策略之间距离的上界。此外,我们证明在低异构性机制下,与单智能体设置相比,当学习每个智能体的最优策略时,FedLQR 实现的样本复杂度降低与智能体数量 MM 成正比。

关键词

引用

@article{arxiv.2308.11743,
  title  = {Model-free Learning with Heterogeneous Dynamical Systems: A Federated LQR Approach},
  author = {Han Wang and Leonardo F. Toso and Aritra Mitra and James Anderson},
  journal= {arXiv preprint arXiv:2308.11743},
  year   = {2023}
}