MarlRank:多智能体强化学习排序模型
机器学习
2019-09-17 v1 信息检索
机器学习
摘要
在估计查询与文档间相关性时,排序模型在很大程度上忽略了文档间的互信息。一个普遍认知是,若两文档就同一查询而言相似,则它们更可能具有相近的相关性得分。为缓解该问题,本文提出一种多智能体强化排序模型,名为 MarlRank。具体而言,通过将每篇文档视为一个智能体,我们将排序过程建模为多智能体马尔可夫决策过程(MDP),其中文档间的相互作用被纳入排序过程。为计算排序列表,每篇文档在预测其对查询的相关性时,不仅考虑自身的查询-文档特征,还考虑其相似文档的特征与动作。通过将奖励定义为 NDCG 的函数,我们可直接针对排序性能指标优化模型。在两个 LETOR 基准数据集上的实验结果表明,我们的模型相较最先进基线具有显著性能提升。我们还发现 NDCG 随交互步数呈整体上升趋势,这表明文档间的互信息有助于提升排序性能。
引用
@article{arxiv.1909.06859,
title = {MarlRank: Multi-agent Reinforced Learning to Rank},
author = {Shihao Zou and Zhonghua Li and Mohammad Akbari and Jun Wang and Peng Zhang},
journal= {arXiv preprint arXiv:1909.06859},
year = {2019}
}
备注
CIKM 2019