基于大语言模型和强化学习优化顶部-k 推荐的新颖性
信息检索
2024-06-21 v1 机器学习
摘要
给定输入查询,推荐模型会根据用户反馈数据(例如点击数据)进行训练,以输出排序的项目列表。在现实系统中,除了准确度外,新模型的一个重要考虑是其顶部-k 推荐相对于现有部署模型的新颖性。然而,优化模型以实现顶部-k 项目的新颖性是一个困难的目标,因为这涉及对模型预测进行非可微排序操作。此外,新项目因其定义而没有任何用户反馈数据。鉴于大语言模型的语义能力,我们使用强化学习(RL)框架来解决这些问题,其中大语言模型为新项目提供反馈。然而,鉴于数以百万计的候选项目,标准 RL 算法的样本复杂度可能非常高。为了降低样本复杂度,我们将顶部-k 列表奖励简化为项目级奖励,并将状态空间重新格式化为由 <查询, 项目> 元组构成的结构,以便将动作空间简化为二元决策;我们表明,这种重新格式化在项目数量较大时显著降低了复杂度。我们在大规模搜索引擎上的查询-广告推荐任务上评估了所提出算法。与在最近的 <查询, 广告> 对上进行监督微调相比,所提出的基于 RL 的算法在召回率几乎不变的情况下实现了显著的新颖性提升。在 ORCAS 查询-网页匹配数据集和基于亚马逊评论的产品推荐数据集上也获得了类似结果。
引用
@article{arxiv.2406.14169,
title = {Optimizing Novelty of Top-k Recommendations using Large Language Models and Reinforcement Learning},
author = {Amit Sharma and Hua Li and Xue Li and Jian Jiao},
journal= {arXiv preprint arXiv:2406.14169},
year = {2024}
}
备注
Accepted at KDD 2024