中文

融合知识且带上限置信界的关系型上下文赌博机策略梯度方法

机器学习 2021-06-29 v1 人工智能

摘要

上下文赌博机(Contextual Bandits)在在线广告、推荐系统、医疗等各真实场景中有重要应用。然而,多数算法使用扁平特征向量表示上下文,而在真实世界中,上下文中存在数量可变的对象及它们之间的关系需要建模。例如,在音乐推荐系统中,用户上下文包含其收听的音乐、创作这些音乐的艺术家、艺术家专辑等。加入更丰富的关联上下文表示也引入了大得多的上下文空间,使探索-利用更加困难。为提高探索-利用效率,可注入关于上下文的知识以引导探索-利用策略。关联上下文表示因其描述性而允许人以自然方式指定知识。我们提出将知识融合策略梯度(Knowledge Infused Policy Gradients)适配到上下文赌博机设定,并给出一种新颖的知识融合策略梯度上限置信界(Knowledge Infused Policy Gradients Upper Confidence Bound)算法,在一个模拟音乐推荐数据集及多个真实数据集上进行了实验分析,其中专家知识可大幅降低总后悔值,也有一些情况下不能。

关键词

引用

@article{arxiv.2106.13895,
  title  = {Knowledge Infused Policy Gradients with Upper Confidence Bound for Relational Bandits},
  author = {Kaushik Roy and Qi Zhang and Manas Gaur and Amit Sheth},
  journal= {arXiv preprint arXiv:2106.13895},
  year   = {2021}
}

备注

Accepted for publication in the research track at ECML-PKDD 2021