中文

带强盗反馈的在线半监督学习

机器学习 2020-10-26 v1 机器学习

摘要

我们提出了半监督学习与上下文强盗交叉处的一个新问题,其动机来自包括临床试验和广告推荐在内的若干应用。我们展示了如何将图卷积网络(GCN)——一种半监督学习方法——调整至这一新问题表述。我们还提出了一种带有半监督缺失奖励填补的线性上下文强盗变体。随后我们取两种方案之长,开发了多-GCN 嵌入上下文强盗。我们的算法在多个真实世界数据集上得到了验证。

关键词

引用

@article{arxiv.2010.12574,
  title  = {Online Semi-Supervised Learning with Bandit Feedback},
  author = {Sohini Upadhyay and Mikhail Yurochkin and Mayank Agarwal and Yasaman Khazaeni and DjallelBouneffouf},
  journal= {arXiv preprint arXiv:2010.12574},
  year   = {2020}
}