Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis
机器学习
2024-09-12 v2 机器学习
最优化与控制
摘要
元学习以其学习如何学习的能力著称,能够跨不同任务调整学习策略。最近的研究引入了 Meta-Thompson Sampling(Meta-TS),通过与来自元先验分布的 bandit 实例交互来元学习未知的先验分布。然而,其分析仅限于高斯 bandit。情境多臂老虎机框架是高斯老虎机的延伸,要求智能体利用情境向量预测最有价值的臂位, optimally 在探索与开发之间取得平衡,以最小化时间内的后悔。本文引入 Meta-TSLB 算法,这是一种用于线性情境老虎机的改进版 Meta-TS。我们对 Meta-TSLB 进行理论分析,推导出其 Bayes后悔的 O((m+log(m))√(n log(n))) 上界,其中 m 表示 bandit 实例的数量,n 表示 Thompson Sampling 的轮数。此外,我们补充了 Meta-TS 在线性情境老虎机中的分析。我们在不同设置下评估了 Meta-TSLB 的性能,并实验并分析了其对未见实例的泛化能力,展示了其适应性潜力。
引用
@article{arxiv.2409.06329,
title = {Modified Meta-Thompson Sampling for Linear Bandits and Its Bayes Regret Analysis},
author = {Hao Li and Dong Liang and Zheng Xie},
journal= {arXiv preprint arXiv:2409.06329},
year = {2024}
}