结构化赌博机的最优学习
机器学习
2023-07-11 v3 最优化与控制
机器学习
摘要
我们研究结构化多臂赌博机,即在存在结构信息的不确定条件下进行在线决策的问题。在该问题中,决策者尽管随时间仅观测到不确定的奖励,仍需发现最佳行动策略。决策者知晓关于奖励分布的某些凸结构信息;即,决策者知道各臂的奖励分布属于一个凸紧集。在存在此类结构信息的情况下,他们希望利用该信息来最小化其遗憾值,其中遗憾值是其相对于一个提前知晓最佳动作的基准策略的性能差异。在缺乏结构信息的情况下,经典的上置信界(UCB)和汤姆森采样算法众所周知能以最小遗憾值运行。然而正如近期所指出的,这两种算法均无法利用实践中普遍存在的结构信息。我们提出了一种称为“DUSA”的新型学习算法,其遗憾值在常数因子范围内匹配信息论遗憾下界,并能处理广泛的结构信息。我们的算法 DUSA 在经验奖励分布处求解遗憾下界的的对偶形式,并遵循其所建议的动作。我们表明,这一思路针对各类结构信息(包括线性、Lipschitz 和凸赌博机等知名结构化赌博机,以及由于缺乏统一灵活框架而尚未被文献研究的新颖结构化赌博机)导出了首个具有渐近最小遗憾值且计算可行的学习策略。
引用
@article{arxiv.2007.07302,
title = {Optimal Learning for Structured Bandits},
author = {Bart P. G. Van Parys and Negin Golrezaei},
journal= {arXiv preprint arXiv:2007.07302},
year = {2023}
}