中文

通过显著性引导Mixup提升因子分解机

信息检索 2022-06-20 v1 机器学习

摘要

因子分解机(FMs)因其适应性及从稀疏数据中学习的能力而广泛用于推荐系统。然而,对于稀疏数据中普遍存在的非交互特征,现有FMs只能通过其嵌入的内积来估计对应这些特征的参数。不可否认,它们无法学习这些特征的直接交互,这限制了模型的表达能力。为此,我们首先提出MixFM,受Mixup启发,生成辅助训练数据以提升FMs。与现有需要人工成本与专业知识收集位置、字段等额外信息的增强策略不同,MixFM生成的额外数据仅通过对原始数据的凸组合得到,无需任何专业知识支持。更重要的是,若待混合的父样本具有非交互特征,MixFM将建立它们的直接交互。其次,考虑到MixFM可能生成冗余甚至有害样本,我们进一步提出一种由显著性引导Mixup驱动的新型因子分解机(记为SMFM)。在定制显著性的引导下,SMFM能生成信息量更丰富的邻域数据。通过理论分析,我们证明所提方法最小化了泛化误差的上界,对增强FMs具有有益效果。值得注意的是,我们给出了FM的第一个泛化界,意味着在充分表示能力下泛化需要更多数据与更小的嵌入尺寸。最后,在五个数据集上的大量实验证实我们的方法优于基线。此外,结果表明“投毒”混合数据同样有益于FM变体。

关键词

引用

@article{arxiv.2206.08661,
  title  = {Boosting Factorization Machines via Saliency-Guided Mixup},
  author = {Chenwang Wu and Defu Lian and Yong Ge and Min Zhou and Enhong Chen and Dacheng Tao},
  journal= {arXiv preprint arXiv:2206.08661},
  year   = {2022}
}