联邦离线策略学习
机器学习
2024-10-14 v2 分布式、并行与集群计算
计量经济学
机器学习
摘要
我们考虑从多个异构数据源的观测 bandit 反馈数据中学习个性化决策策略的问题。在我们的方法中,我们引入了一种新的后悔分析,建立了对所有数据源总体上的全局后悔以及任意给定数据源的局部后悔的可区分概念的有限样本上界。我们用数据源异构性和分布偏移的表达式来刻画这些后悔界。此外,我们考察了该问题在联邦设置中的实际考量,其中中央服务器旨在分布于异构数据源上的数据上训练策略,而不收集它们的任何原始数据。我们提出了一种适于联邦化的策略学习算法,该算法基于使用双重稳健离线策略评估策略训练的局部策略的聚合。我们的分析与支撑性实验结果提供了关于异构数据源参与离线策略学习中的权衡的见解。
引用
@article{arxiv.2305.12407,
title = {Federated Offline Policy Learning},
author = {Aldo Gael Carranza and Susan Athey},
journal= {arXiv preprint arXiv:2305.12407},
year = {2024}
}