中文

联邦神经老虎机

机器学习 2023-03-02 v2 人工智能

摘要

近期关于神经上下文老虎机的工作因其利用神经网络(NN)强大表示能力预测奖励而取得引人注目的性能。上下文老虎机的许多应用涉及多个不共享原始观测而协作的智能体,从而引出联邦上下文老虎机的设定。现有联邦上下文老虎机工作依赖线性或核化老虎机,在建模复杂现实奖励函数时可能不足。因此,本文引入联邦神经上置信界(FN-UCB)算法。为更好利用联邦设定,FN-UCB 采用两个 UCB 的加权组合:UCBa\text{UCB}^{a} 允许每个智能体额外使用其他智能体的观测以加速探索(不共享原始观测),而 UCBb\text{UCB}^{b} 以类似于监督学习中联邦平均的方式使用具聚合参数的 NN 预测奖励。值得注意的是,理论分析所需的两 UCB 间权重可有趣解读:初期强调 UCBa\text{UCB}^{a} 以加速探索,在收集足够观测训练 NN 进行准确奖励预测(即可靠利用)后更多依赖 UCBb\text{UCB}^{b}。我们证明了 FN-UCB 累积遗憾与通信轮数的次线性上界,并实证展示其竞争性能。

关键词

引用

@article{arxiv.2205.14309,
  title  = {Federated Neural Bandits},
  author = {Zhongxiang Dai and Yao Shu and Arun Verma and Flint Xiaofeng Fan and Bryan Kian Hsiang Low and Patrick Jaillet},
  journal= {arXiv preprint arXiv:2205.14309},
  year   = {2023}
}

备注

ICLR 2023. Code: https://github.com/daizhongxiang/Federated-Neural-Bandits