利用强化学习将 GPTRec 与超准确率目标对齐
信息检索
2024-03-11 v1 机器学习
摘要
Transformer 模型的变体,如 BERT4Rec 和 SASRec,在基于准确率的指标(如 NDCG)下的序列推荐任务中取得了 SOTA 性能。这些模型将物品视为 token,然后采用打分与排序方法(Top-K 策略),即模型首先计算物品分数,然后根据该分数进行排序。虽然这种方法在基于准确率的指标上表现良好,但很难将其用于优化更复杂的超准确率指标,如多样性。最近,提出了一种使用不同 Next-K 策略的 GPTRec 模型,作为 Top-K 模型的替代方案。与传统的 Top-K 推荐不同,Next-K 逐个生成推荐,因此可以考虑对超准确率指标很重要的复杂物品间相互依赖关系。然而,原始的 GPTRec 论文在实验中仅关注准确率,并未涉及如何针对复杂的超准确率指标优化模型。事实上,为超准确率目标训练 GPTRec 具有挑战性,因为用于训练推荐系统的交互训练数据通常需要与超准确率推荐目标对齐。为了解决这种不对齐问题,我们采用两阶段方法训练 GPTRec:在第一阶段,我们使用师生方法训练 GPTRec,模拟传统 Top-K 模型的行为;在第二阶段,我们使用强化学习将模型与超准确率目标对齐。具体而言,我们进行了增加推荐多样性和减少流行度偏差的实验。我们在两个数据集上的实验表明,在 4 种情况中的 3 种情况下,GPTRec 的 Next-K 生成方法在准确率和次要指标之间提供了比经典贪婪重排序技术更好的权衡。
关键词
引用
@article{arxiv.2403.04875,
title = {Aligning GPTRec with Beyond-Accuracy Goals with Reinforcement Learning},
author = {Aleksandr Petrov and Craig Macdonald},
journal= {arXiv preprint arXiv:2403.04875},
year = {2024}
}
备注
Accepted by the 2nd Workshop The 2nd Workshop on Recommendation with Generative Models, in conjunction with The Web Conference 2024