BanditRank:利用上下文赌博机的学习排序方法
信息检索
2019-10-24 v1 机器学习
摘要
我们提出了一种可扩展的深度学习方法,使用强化学习来训练神经网络以用于信息检索(IR)中的离线排序。我们称该方法为 BanditRank,因为它将排序视为上下文赌博机(contextual bandit)问题。在IR的学习排序领域中,当前的深度学习模型是在与其评估指标不同的目标函数上训练的。由于大多数评估指标是离散量,若不使用近似,便无法直接利用梯度下降算法进行优化。BanditRank 通过使用梯度下降直接优化特定任务的指标(如平均精度均值(MAP))来弥补这一差距。具体而言,一个动作是对输入文档进行排序的上下文赌博机,使用策略梯度算法进行训练,以直接最大化奖励。奖励可以是单一指标(如MAP)或若干指标的组合。与当前的列表式(listwise)方法类似,排序的概念也内嵌于 BanditRank 中。为评估 BanditRank 的有效性,我们在涉及三种不同任务(即网页搜索、社区问答和事实型问答)的数据集上进行了一系列实验。我们发现,当应用于问答数据集时,其性能优于最先进的方法。在网页搜索数据集上,我们发现 BanditRank 优于四种强大的列表式基线方法,包括 LambdaMART、AdaRank、ListNet 和 Coordinate Ascent。
引用
@article{arxiv.1910.10410,
title = {BanditRank: Learning to Rank Using Contextual Bandits},
author = {Phanideep Gampa and Sumio Fujita},
journal= {arXiv preprint arXiv:1910.10410},
year = {2019}
}
备注
9 pages