面向公平在线排序学习的探索-利用权衡校准
信息检索
2021-11-02 v1 机器学习
摘要
在线排序学习(OL2R)近年来引起了极大的研究兴趣,得益于其避免了离线监督排序模型学习所需的高昂相关性标注。该方案通过探索未知(例如有意将选定结果置于顶部位置)来改进其相关性估计。然而这引发了对其排序公平性的担忧:不同组别的物品在OL2R过程中可能受到差异化对待。但现有公平排序方案通常需要事先知道结果相关性或有一个可用的排序器,这与OL2R的设置矛盾,因而无法直接应用于保障公平性。本工作中,我们提出一个通用框架,以实现OL2R中由组别曝光定义的公平性。核心思想是对探索与利用进行校准,以控制公平性、相关性学习和在线排序质量。具体而言,当模型探索一组结果以获取相关性反馈时,我们将探索限制在随机排列的子集内,在保持跨组公平性的同时反馈仍是无偏的。理论上我们证明该策略在获得公平性的同时给OL2R的regret引入了最小扭曲。在两个公开学习排序基准数据集上的广泛实证分析证明了所提方案相比现有公平OL2R方案的有效性。
引用
@article{arxiv.2111.00735,
title = {Calibrating Explore-Exploit Trade-off for Fair Online Learning to Rank},
author = {Yiling Jia and Hongning Wang},
journal= {arXiv preprint arXiv:2111.00735},
year = {2021}
}