公平无偏排序函数的策略梯度训练
机器学习
2021-05-11 v2 计算机与社会
信息检索
机器学习
摘要
尽管隐式反馈(如点击、停留时间等)是学习排序中丰富且有吸引力的数据来源,但它会因外生和内生原因产生不公平的排序策略。外生原因通常表现为训练数据中的偏差,这些偏差随后反映在习得的排序策略中,并常导致富者愈富的动态。此外,即使在此类偏差被纠正后,学习算法设计中的内生原因仍可能导致排序策略无法以公平方式在各项之间分配曝光。为同时解决外生与内生不公平来源,我们提出了首个同时处理展示偏差与基于价值的曝光公平性的学习排序方法。具体而言,我们定义了一类可根据应用需求选择的摊销式曝光公平约束,并展示了尽管隐式反馈数据中存在选择偏差,这些公平准则仍可得以强制执行。关键成果是一个高效且灵活的策略梯度算法,称为 FULTR,它首个实现了将反事实估计量同时用于效用估计与公平约束。除该框架的理论论证外,我们通过实证表明,所提算法能从有偏且含噪的反馈中学习到准确且公平的排序策略。
引用
@article{arxiv.1911.08054,
title = {Policy-Gradient Training of Fair and Unbiased Ranking Functions},
author = {Himank Yadav and Zhengxiao Du and Thorsten Joachims},
journal= {arXiv preprint arXiv:1911.08054},
year = {2021}
}