未识别与混淆?理解无偏学习排序的双塔模型
信息检索
2025-06-26 v1 机器学习
摘要
加性双塔模型是处理工业环境中偏好用户反馈的流行学习排序方法。最近的研究然而报告了令人关切的现象:在由表现良好的生产系统收集的点击数据上训练双塔模型会导致排序性能下降。本文检讨两个最新的解释:来自日志策略的混淆效应和模型可识别性问题。我们理论分析双塔模型的可识别性条件,表明需要跨位置的文件交换或重叠的特征分布才能从点击数据中恢复模型参数。我们还研究日志策略对双塔模型的影响,发现当模型完美捕获用户行为时,日志策略不会引入偏差。然而,当模型不完美地捕获用户行为时,日志策略会放大偏差,特别是当预测误差与文件在跨位置上的放置相关时。我们提出一种样本加权技术来缓解这些影响,并为使用双塔模型的研究者和实践者提供可操作的见解。
引用
@article{arxiv.2506.20501,
title = {Unidentified and Confounded? Understanding Two-Tower Models for Unbiased Learning to Rank},
author = {Philipp Hager and Onno Zoeter and Maarten de Rijke},
journal= {arXiv preprint arXiv:2506.20501},
year = {2025}
}