通过稳健统计实现多任务学习与_bandits_
机器学习
2024-07-30 v5 机器学习
统计理论
统计理论
摘要
决策者常同时面对许多相关但异质的学问题。例如,大型零售商可能希望了解不同门店的产品需求以解决定价或库存问题,从而希望对服务相似顾客的门店联合学习;或者,医院网络可能希望了解不同医疗机构的患者风险以分配个性化干预,从而希望对服务相似患者群体的医院联合学习。受真实数据集启发,我们研究一种自然设定:每个学习实例中的未知参数可分解为一个共享全局参数加一个稀疏的实例特定项。我们提出一种新颖的两阶段多任务学习估计器,以样本高效的方式利用该结构,独特结合稳健统计(跨相似实例学习)与 LASSO 回归(对结果去偏)。相对于常用估计器,我们的估计器在特征维度 上给出了改进的采样复杂度界;对于“数据贫乏”的实例,该改进是指数级的,此类实例从多任务学习中获益最大。我们通过将多任务估计器嵌入同步上下文_bandit_算法,说明了这些结果在在线学习中的效用。我们指定了估计器的动态校准,以随时间适当平衡偏差-方差权衡,从而改进上下文维度 下的后悔界。最后,我们在合成与真实数据集上展示了我们方法的价值。
引用
@article{arxiv.2112.14233,
title = {Multitask Learning and Bandits via Robust Statistics},
author = {Kan Xu and Hamsa Bastani},
journal= {arXiv preprint arXiv:2112.14233},
year = {2024}
}