中文

从局部索引到全局标识:基于全局行动空间的生成式重排序用于推荐系统

机器学习 2026-04-29 v1 计算机视觉与模式识别

摘要

在现代推荐系统中,列表级重排序是多阶段流水线中的关键阶段,最终决定公开的物品序列,直接影响用户满意度通过建模复杂的物品间依赖。现有方法通常将此任务表述为从局部输入列表中选择索引。然而,这种方法存在语义不一致的行动空间:相同的输出神经元(logits)在不同样本中代表不同的物品,阻止模型建立稳定、内在的物品理解。为此,我们提出 GloRank(全局行动空间排序器),一种生成式框架,将重排序从选择局部索引转变为生成全局标识。具体而言,我们将物品表示为离散标记序列,将重排序重新表述为标记生成任务。此设计有效地将评分机制与可变输入顺序解耦,确保物品针对一致的全局标准进行评估。我们进一步通过两个阶段的优化管线实现:监督预训练阶段以高质量演示初始化模型,随后是基于强化学习的后训练阶段以直接最大化列表级效用。大量实验在两个公共基准和大规模工业数据集上进行,并通过在线 A/B 测试表明,GloRank 持续优于最先进的基线方法,并在冷启动场景中实现优异的鲁棒性。

关键词

引用

@article{arxiv.2604.25289,
  title  = {Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds},
  author = {Liuzhuozheng Li and Zhiyuan Zhan and Shuhong Liu and Dengyang Jiang and Zanyi Wang and Guang Dai and Jingdong Wang and Mengmeng Wang},
  journal= {arXiv preprint arXiv:2604.25289},
  year   = {2026}
}