面向无监督序列选择的 Thompson 采样算法
机器学习
2020-09-17 v1 机器学习
摘要
Thompson 采样因其比基于上置信界(upper confidence bound)的算法具有更好的经验性能而引起了极大关注。在本文中,我们研究用于无监督序列选择(Unsupervised Sequential Selection, USS)问题的基于 Thompson 采样的算法。USS 问题是随机多臂老虎机问题的一个变体,其中臂的损失无法从观测到的反馈中推断。在 USS 设定中,臂具有固定成本且有序排列,形成一个级联。在每轮中,学习者选择一个臂并观测到直至所选臂为止的反馈。学习者的目标是找到使期望总损失最小的臂。总损失是选择该臂所产生的成本与所选臂相关的随机损失之和。该问题具有挑战性,因为在不了解平均损失的情况下,无法计算所选臂的总损失。显然,仅当最优臂可从问题结构中推断时学习才可行。如先前工作所示,当问题实例满足所谓的“弱优势”(Weak Dominance, WD)性质时,学习是可能的。在 WD 下,我们证明我们针对 USS 问题的基于 Thompson 采样的算法实现了近最优后悔值,并且比现有算法具有更好的数值性能。
引用
@article{arxiv.2009.07554,
title = {Thompson Sampling for Unsupervised Sequential Selection},
author = {Arun Verma and Manjesh K. Hanawal and Nandyala Hemachandra},
journal= {arXiv preprint arXiv:2009.07554},
year = {2020}
}
备注
Accepted to ACML 2020