中文

基于 Bandit 反馈的多任务离屏学习

机器学习 2022-12-12 v1 人工智能

摘要

许多实际应用,如推荐系统和学习排序,涉及求解多个相似任务。一个例子是为具有相似电影偏好的用户学习推荐策略,这些用户仍可能对单个电影有略微不同的排序。此类任务可组织为层次结构,其中相似任务通过共享结构相关联。在这项工作中,我们将此问题表述为基于记录 bandit 反馈的层次图模型中的上下文离屏优化。为求解该问题,我们提出一种层次离屏优化算法(HierOPO),其估计层次模型的参数并随后对之采取悲观行动。我们在线性高斯模型中实例化 HierOPO,并为其提供高效的实现与分析。我们证明了所学策略的次优性在每个任务上的界,显示出相较不使用层次模型的明显改进。我们还对策略进行了经验评估。我们的理论与经验结果均显示出使用层次结构相对于独立求解各任务的明显优势。

关键词

引用

@article{arxiv.2212.04720,
  title  = {Multi-Task Off-Policy Learning from Bandit Feedback},
  author = {Joey Hong and Branislav Kveton and Sumeet Katariya and Manzil Zaheer and Mohammad Ghavamzadeh},
  journal= {arXiv preprint arXiv:2212.04720},
  year   = {2022}
}

备注

14 pages, 3 figures