中文

具有结构化偏好反馈的纯探索问题

机器学习 2021-04-13 v1

摘要

我们考虑具有子集级偏好反馈的纯探索问题,该问题包含 NN 个带特征的臂。学习者被允许查询大小为 KK 的子集,并以带噪获胜者的形式接收反馈。学习者的目标是以尽可能少的查询高效地识别出最优臂。该设定在各种涉及人类反馈的在线决策场景中是相关的,例如在线零售、流媒体服务、新闻推送和在线广告;因为人们从子集中选择偏好项比孤立地对某项分配喜好评分更容易且更可靠。据我们所知,这是首项在结构化设定中考虑子集级偏好反馈模型的工作,该设定允许潜在无限的臂集合。我们提出了两种算法,能以至少 1δ1 - \delta 的概率在 O~(d2KΔ2)\tilde{O} (\frac{d^2}{K \Delta^2}) 个样本中保证检测出最优臂,其中 dd 为臂特征的维度,Δ\Delta 为臂间效用的适当间隙概念。我们还推导了实例相关的下界 Ω(dΔ2log1δ)\Omega(\frac{d}{\Delta^2} \log \frac{1}{\delta}),该下界在最坏情况实例上与我们的上界相匹配。最后,我们进行了大量实验以证实我们的理论发现,并观察到我们的自适应算法会停止,且所需的样本数比非自适应算法最多少 12 倍。

关键词

引用

@article{arxiv.2104.05294,
  title  = {Pure Exploration with Structured Preference Feedback},
  author = {Shubham Gupta and Aadirupa Saha and Sumeet Katariya},
  journal= {arXiv preprint arXiv:2104.05294},
  year   = {2021}
}