中文

具有上下文分布与阶段性约束的随机老虎机分布式多任务学习

机器学习 2025-04-29 v3 多智能体系统

摘要

我们提出了在具有异构智能体的随机线性上下文老虎机中的保守分布式多任务学习。这将保守线性老虎机扩展到了分布式环境中,其中 M 个智能体在遵守阶段性性能约束的同时处理不同但相关的任务。确切上下文是未知的,智能体仅能获得上下文分布,这如同在涉及推断上下文预测机制的许多实际应用中一样,例如股市预测和天气预报。我们提出了一种分布式上置信界(UCB)算法 DiSC-UCB。我们的算法在每轮中构建一个剪枝后的动作集,以确保满足约束。此外,它通过中心服务器,利用结构良好的同步步骤在智能体之间同步共享估计值。我们证明了该算法的遗憾界和通信界。我们将该问题扩展到智能体未知基线奖励的设定。针对此设定,我们提供了一种改进的算法 DiSC-UCB2,并证明该改进算法能达到相同的遗憾界和通信界。我们在合成数据和真实世界的 Movielens-100K 数据上实证验证了算法的性能。

关键词

引用

@article{arxiv.2401.11563,
  title  = {Distributed Multi-Task Learning for Stochastic Bandits with Context Distribution and Stage-wise Constraints},
  author = {Jiabin Lin and Shana Moothedath},
  journal= {arXiv preprint arXiv:2401.11563},
  year   = {2025}
}