FedQHD: 基于超维特征的闭式函数空间联邦强化学习
机器学习
2026-05-29 v1 分布式、并行与集群计算
摘要
联邦强化学习允许在不交换原始轨迹的情况下,让去中心化智能体协同改进策略或价值估计。然而,基于FedAvg的参数平均方法在函数空间上不一致:当客户端使用异构的编码器甚至是相同的非线性网络时,平均后的参数可能不对应于任何常见函数空间中客户端价值函数的加权平均。我们提出了FedQHD,这是一种基于超维(随机特征)状态编码器和线性读取器的联邦Q学习方法,使得Q函数在状态上是非线性的,但在可训练参数上是线性的。这种线性结构使得聚合能够以闭式形式实现。当编码器共享时,函数空间一致性更新恰好等于本地读取矩阵的加权平均。当编码器异构时,服务器通过在共享锚定状态集合上平均客户端Q值来构建全局教师,而每个客户端通过一次岭投影将该教师编译到本地表示中。我们相对于客户端特定的oracle投影,形式化了联邦间隙——即将联邦教师编译到异构客户端表示中所产生的误差。我们进一步指出,在锚定状态到维数比 为良好条件范畴时,间隙可简化为编码器异构性底限的一个倍数。我们在四个连续状态、离散动作控制基准测试中表明,FedQHD 在匹配或超越FedAvg风格基线和基于蒸馏的替代方案方面表现出色,同时计算需求大幅降低,实证的联邦间隙随编码器维数的依赖性与我们的理论分析相吻合。
引用
@article{arxiv.2605.29002,
title = {FedQHD: Closed-Form Function-Space Federated Reinforcement Learning},
author = {Yuchen Hou and Yongshan Chen and Zhuowen Zou and Calvin Yeung and Mohsen Imani and Tian Lan and Mahdi Imani},
journal= {arXiv preprint arXiv:2605.29002},
year = {2026}
}