面向联邦多臂老虎机的奖励教导
机器学习
2023-11-21 v2 信息论
机器学习
信号处理
math.IT
摘要
现有大多数联邦多臂老虎机(FMAB)设计都基于客户端将执行指定设计以与服务器协作的假设。然而在现实中,可能无法修改客户端已有的协议。为应对这一挑战,本文关注始终最大化自身累积奖励的客户端,并引入“奖励教导”这一新思路:服务器通过隐式的局部奖励调整将客户端引导至全局最优。在此框架下,服务器面临_bandit 学习与目标教导两个紧密耦合的任务,其结合是非平凡且具挑战性的。我们首先设计了一种称为教导后学习(TAL)的分阶段方法,分别鼓励和抑制客户端的探索。在客户端策略满足某些温和条件时,建立了 TAL 的通用性能分析。借助为分析老虎机算法预热启动行为而发展的新技术手段,进一步获得了客户端运行 UCB 或 epsilon-greedy 策略时 TAL 的具体保证。这些结果表明,TAL 在实现对数后悔的同时仅产生对数调整代价,相对于自然下界是阶最优的。作为进一步扩展,我们基于连续臂消除思想开发了教导中学习(TWL)算法,以打破 TAL 中非自适应的阶段分离。严格分析表明,当面对运行 UCB1 的客户端时,得益于自适应设计,TWL 在次优间隙的依赖上优于 TAL。实验结果证明了所提算法的有效性与通用性。
引用
@article{arxiv.2305.02441,
title = {Reward Teaching for Federated Multi-armed Bandits},
author = {Chengshuai Shi and Wei Xiong and Cong Shen and Jing Yang},
journal= {arXiv preprint arXiv:2305.02441},
year = {2023}
}
备注
Accepted to IEEE Transactions on Signal Processing