梯度空间高效探索的在线排序学习
信息检索
2018-11-28 v1 机器学习
摘要
在线排序学习(OL2R)基于直接从用户收集的隐式反馈优化返回搜索结果的效用。为改进估计,OL2R算法考察一个或多个探索性梯度方向,并通过交织测试在用户偏好某个提议排序器时更新当前排序器。在本文中,我们通过梯度空间中的高效探索加速在线学习过程。我们的算法称为零空间梯度下降(Null Space Gradient Descent),将探索空间缩减为近期表现不佳梯度的零空间。这防止算法重复探索已被最近用户交互所抑制的方向。为提高所得交织测试的灵敏度,我们有选择地构造候选排序器以最大化其能被当前查询中候选排序文档区分的机会;并在比较排序器出现平局时使用历史上困难的查询来识别最佳排序器。在多个公共基准上与最先进OL2R算法的广泛实验比较证实了我们所提算法的有效性,尤其体现在其快速学习收敛与早期阶段有前景的排序质量。
引用
@article{arxiv.1805.07317,
title = {Efficient Exploration of Gradient Space for Online Learning to Rank},
author = {Huazheng Wang and Ramsey Langley and Sonwoo Kim and Eric McCord-Snook and Hongning Wang},
journal= {arXiv preprint arXiv:1805.07317},
year = {2018}
}
备注
To appear on SIGIR '18: The 41st International ACM SIGIR Conference on Research & Development in Information Retrieval