中文

面向无监督序列选择的 Thompson 采样算法

机器学习 2020-09-17 v1 机器学习

摘要

Thompson 采样因其比基于上置信界(upper confidence bound)的算法具有更好的经验性能而引起了极大关注。在本文中,我们研究用于无监督序列选择(Unsupervised Sequential Selection, USS)问题的基于 Thompson 采样的算法。USS 问题是随机多臂老虎机问题的一个变体,其中臂的损失无法从观测到的反馈中推断。在 USS 设定中,臂具有固定成本且有序排列,形成一个级联。在每轮中,学习者选择一个臂并观测到直至所选臂为止的反馈。学习者的目标是找到使期望总损失最小的臂。总损失是选择该臂所产生的成本与所选臂相关的随机损失之和。该问题具有挑战性,因为在不了解平均损失的情况下,无法计算所选臂的总损失。显然,仅当最优臂可从问题结构中推断时学习才可行。如先前工作所示,当问题实例满足所谓的“弱优势”(Weak Dominance, WD)性质时,学习是可能的。在 WD 下,我们证明我们针对 USS 问题的基于 Thompson 采样的算法实现了近最优后悔值,并且比现有算法具有更好的数值性能。

关键词

引用

@article{arxiv.2009.07554,
  title  = {Thompson Sampling for Unsupervised Sequential Selection},
  author = {Arun Verma and Manjesh K. Hanawal and Nandyala Hemachandra},
  journal= {arXiv preprint arXiv:2009.07554},
  year   = {2020}
}

备注

Accepted to ACML 2020