中文

BanditRank:利用上下文赌博机的学习排序方法

信息检索 2019-10-24 v1 机器学习

摘要

我们提出了一种可扩展的深度学习方法,使用强化学习来训练神经网络以用于信息检索(IR)中的离线排序。我们称该方法为 BanditRank,因为它将排序视为上下文赌博机(contextual bandit)问题。在IR的学习排序领域中,当前的深度学习模型是在与其评估指标不同的目标函数上训练的。由于大多数评估指标是离散量,若不使用近似,便无法直接利用梯度下降算法进行优化。BanditRank 通过使用梯度下降直接优化特定任务的指标(如平均精度均值(MAP))来弥补这一差距。具体而言,一个动作是对输入文档进行排序的上下文赌博机,使用策略梯度算法进行训练,以直接最大化奖励。奖励可以是单一指标(如MAP)或若干指标的组合。与当前的列表式(listwise)方法类似,排序的概念也内嵌于 BanditRank 中。为评估 BanditRank 的有效性,我们在涉及三种不同任务(即网页搜索、社区问答和事实型问答)的数据集上进行了一系列实验。我们发现,当应用于问答数据集时,其性能优于最先进的方法。在网页搜索数据集上,我们发现 BanditRank 优于四种强大的列表式基线方法,包括 LambdaMART、AdaRank、ListNet 和 Coordinate Ascent。

关键词

引用

@article{arxiv.1910.10410,
  title  = {BanditRank: Learning to Rank Using Contextual Bandits},
  author = {Phanideep Gampa and Sumio Fujita},
  journal= {arXiv preprint arXiv:1910.10410},
  year   = {2019}
}

备注

9 pages