中文

MarlRank:多智能体强化学习排序模型

机器学习 2019-09-17 v1 信息检索 机器学习

摘要

在估计查询与文档间相关性时,排序模型在很大程度上忽略了文档间的互信息。一个普遍认知是,若两文档就同一查询而言相似,则它们更可能具有相近的相关性得分。为缓解该问题,本文提出一种多智能体强化排序模型,名为 MarlRank。具体而言,通过将每篇文档视为一个智能体,我们将排序过程建模为多智能体马尔可夫决策过程(MDP),其中文档间的相互作用被纳入排序过程。为计算排序列表,每篇文档在预测其对查询的相关性时,不仅考虑自身的查询-文档特征,还考虑其相似文档的特征与动作。通过将奖励定义为 NDCG 的函数,我们可直接针对排序性能指标优化模型。在两个 LETOR 基准数据集上的实验结果表明,我们的模型相较最先进基线具有显著性能提升。我们还发现 NDCG 随交互步数呈整体上升趋势,这表明文档间的互信息有助于提升排序性能。

关键词

引用

@article{arxiv.1909.06859,
  title  = {MarlRank: Multi-agent Reinforced Learning to Rank},
  author = {Shihao Zou and Zhonghua Li and Mohammad Akbari and Jun Wang and Peng Zhang},
  journal= {arXiv preprint arXiv:1909.06859},
  year   = {2019}
}

备注

CIKM 2019