联邦上下文_bandit算法的实证评估
机器学习
2023-03-21 v1 人工智能
摘要
随着联邦学习在从用户设备本地敏感数据中学习的应用日益增多,自然会问:是否可以利用用户与感兴趣应用交互时产生的隐式信号来进行学习,而无需访问在许多任务中难以获取的显式标签。我们以联邦上下文_bandit框架处理此类问题,并针对联邦设定开发了集中式设定中著名上下文_bandit算法的变体。我们使用公开可用数据集在一系列模拟场景中仔细评估这些算法。我们的模拟建模了现实世界中遇到的典型设置,例如由于数据非平稳性和/或客户端异质性导致的初始预训练模型与后续用户交互之间的各种错位。我们的实验揭示了简单且常用的softmax启发式方法在平衡我们各类设置中众所周知的探索-利用权衡方面出奇的有效性。
引用
@article{arxiv.2303.10218,
title = {An Empirical Evaluation of Federated Contextual Bandit Algorithms},
author = {Alekh Agarwal and H. Brendan McMahan and Zheng Xu},
journal= {arXiv preprint arXiv:2303.10218},
year = {2023}
}