理解和抵消点击率预测中的特征级偏差
信息检索
2024-02-07 v1
摘要
常见的点击率(CTR)预测推荐模型倾向于表现出特征级偏差,这导致不同物品组之间的推荐不公平,并对用户的推荐不够准确。虽然现有方法通过调整CTR模型的学习方式(例如通过额外的优化目标)来解决此问题,但未能考虑偏差在这些模型内部是如何产生的。为填补这一研究空白,我们对代表性CTR模型进行自上而下的分析。通过逐一屏蔽训练好的CTR模型的不同组件,我们识别出线性组件对特征级偏差的贡献至关重要。我们对线性组件权重的学习过程进行了理论分析,揭示了训练数据中组间属性如何影响这些权重。我们的实验和统计分析表明,不同物品组中正样本比例不平衡与特征级偏差之间存在强烈相关性。基于这一理解,我们提出了一种 minimally侵入性却有效的策略,通过移除训练好的模型中的偏差线性权重来抵消CTR模型中的特征级偏差。此外,我们还提出了一种需要随机曝光记录更少的线性权重调整策略。通过在三个真实世界数据集上的大量实验验证,我们证明了我们提出的方法的优越性。
引用
@article{arxiv.2402.03600,
title = {Understanding and Counteracting Feature-Level Bias in Click-Through Rate Prediction},
author = {Jinqiu Jin and Sihao Ding and Wenjie Wang and Fuli Feng},
journal= {arXiv preprint arXiv:2402.03600},
year = {2024}
}