中文

生成式推荐的序列数据增强

机器学习 2026-05-21 v3 信息检索

摘要

生成式推荐在个性化系统中扮演关键角色,从历史行为序列预测用户的未来交互。训练这些模型的一个关键且未被充分探索的因素是数据增强,即从用户交互历史构建训练数据的过程。通过塑造训练分布,数据增强直接且常常显著影响模型的泛化和性能。然而,在大多数现有工作中,这一过程被简化、应用不一致或被当作次要设计选择,而缺乏对其影响的系统性和原则性理解。受我们发现不同增强策略可导致显著性能差异的启发,我们深入分析了它们如何重塑训练分布并影响与未来目标的对齐以及对未见输入的泛化。为系统化这一设计空间,我们提出 GenPAS,一个通用且原则化的框架,将增强建模为输入-目标对上随机抽样过程,包含三个可控偏置的步骤:序列抽样、目标抽样和输入抽样。该表述将广泛使用的策略作为特殊案例统一起来,并可灵活控制结果训练分布。我们在基准数据集和工业数据集上的大量实验表明,GenPAS 在准确率、数据效率和参数效率方面优于现有策略,为生成式推荐的原则性训练数据构建提供了实用指导。我们的代码已在 https://github.com/snap-research/GenPAS 上提供。

关键词

引用

@article{arxiv.2509.13648,
  title  = {Sequential Data Augmentation for Generative Recommendation},
  author = {Geon Lee and Bhuvesh Kumar and Clark Mingxuan Ju and Tong Zhao and Kijung Shin and Neil Shah and Liam Collins},
  journal= {arXiv preprint arXiv:2509.13648},
  year   = {2026}
}