具有端到端赌博反馈的多阶段系统的分布式无悔学习
机器学习
2024-08-20 v2 网络与互联网体系结构
摘要
本文研究具有端到端赌博反馈的多阶段系统。在此类系统中,每个作业在产生结果前需要经历多个阶段,每个阶段由不同的智能体管理。每个智能体只能控制自己的动作并获知作业的最终结果。它对下一阶段智能体所采取的动作既不了解也无法控制。本文的目标是开发在对抗环境中实现次线性遗憾的分布式在线学习算法。本文的设定显著扩展了仅考虑单一智能体和单一阶段的传统多臂赌博机问题。除了传统多臂赌博机问题中的探索-利用困境外,我们表明,多阶段的考虑引入了第三个组成部分——教导,即智能体需要选择其动作以促进下一阶段智能体的学习。为了解决这一新引入的探索-利用-教导三难困境,我们提出了一种简单的分布式在线学习算法 EXP3。我们在理论上证明了 EXP3 算法是一种实现次线性遗憾的无悔策略。仿真结果表明,对于传统的多臂赌博机问题,EXP3 算法显著优于现有的无悔在线学习算法。
引用
@article{arxiv.2404.04509,
title = {Distributed No-Regret Learning for Multi-Stage Systems with End-to-End Bandit Feedback},
author = {I-Hong Hou},
journal= {arXiv preprint arXiv:2404.04509},
year = {2024}
}
备注
Accepted in ACM MobiHoc 2024