通过迁移奖励样本利用多臂老虎机任务中的相邻相似性
机器学习
2025-03-14 v2 机器学习
摘要
我们考虑一个顺序性多任务问题,其中每个任务均建模为K臂随机多臂老虎机。在此模型下,假设各老虎机任务之间存在相邻相似性,即任意两个连续任务的臂均值奖励差值受参数加以上界限制。我们提出两种算法(一种假设该参数已知,另一种假设该参数未知),基于UCB算法通过迁移前序任务的奖励样本以改善跨所有任务的总体报酬。我们的分析表明,与无迁移情况相比,迁移样本可降低累积报酬。我们提供的实证结果表明,所提算法在不使用迁移的标准UCB算法和一种粗糙的迁移算法之上均表现出性能提升。
引用
@article{arxiv.2409.19975,
title = {Exploiting Adjacent Similarity in Multi-Armed Bandit Tasks via Transfer of Reward Samples},
author = {NR Rahul and Vaibhav Katewa},
journal= {arXiv preprint arXiv:2409.19975},
year = {2025}
}