基于策略超网络的可控多目标重排序
信息检索
2023-07-19 v3
摘要
多阶段排序流水线已成为现代推荐系统中广泛使用的策略,其中最终阶段旨在返回一个平衡若干需求(如用户偏好、多样性、新颖性等)的排序物品列表。线性标量化可以说是最广泛使用的技术,通过以特定偏好权重对需求求和,将多个需求合并为一个优化目标。现有的最终阶段排序方法通常采用静态模型,其中偏好权重在离线训练时确定并在在线服务时保持不变。每当需要修改偏好权重时,模型必须重新训练,这在时间和资源上效率低下。同时,最合适的权重对于不同目标用户群体或不同时间段(例如节假日促销期间)可能差异很大。在本文中,我们提出了一个称为可控多目标重排序(CMR)的框架,其包含超网络以根据不同偏好权重生成重排序模型的参数。通过这种方式,CMR 能够以适应环境变化的方式在线调整偏好权重,而无需重新训练模型。此外,我们将实际业务导向任务分为四类,并无缝地将其纳入基于 Actor-Evaluator 框架新提出的重排序模型中,该模型作为 CMR 可靠的真实世界测试平台。基于淘宝 App 收集数据集的离线实验表明,CMR 以若干流行重排序模型作为底层模型时提升了它们的效果。在线 A/B 测试也证明了 CMR 的有效性与可信性。
引用
@article{arxiv.2306.05118,
title = {Controllable Multi-Objective Re-ranking with Policy Hypernetworks},
author = {Sirui Chen and Yuan Wang and Zijing Wen and Zhiyu Li and Changshuo Zhang and Xiao Zhang and Quan Lin and Cheng Zhu and Jun Xu},
journal= {arXiv preprint arXiv:2306.05118},
year = {2023}
}