利用生成对抗网络为协同过滤推荐系统创建合成数据集
信息检索
2023-03-03 v1 机器学习
摘要
机器学习的研究与教育需要多样、具代表性且开放的 dataset,其包含充足样本以处理必要的训练、验证与测试任务。当前,推荐系统领域包含大量子领域,其中准确度和超越准确度的质量度量被持续改进。为滋养此研究多样性,以合成数据集强化现有数据集是必要且便利的。本文提出一种基于生成对抗网络(GAN)的方法,以参数化方式生成协同过滤数据集,通过选定偏好的用户数、物品数、样本数与随机可变度。此参数化无法用常规 GAN 实现。我们的 GAN 模型以物品与用户的稠密、短小且连续的嵌入表示(而非稀疏、庞大且离散的向量)作为输入,从而相较基于庞大稀疏输入向量的传统方法实现准确快速的学习。所提架构包含 DeepMF 模型以提取稠密用户与物品嵌入,以及聚类过程将稠密 GAN 生成样本转换为离散稀疏样本,以创建各所需合成数据集。三个不同源数据集的结果显示,相较源数据集,生成数据集具有恰当分布与预期质量值及演化。合成数据集与源代码向研究者开放。
引用
@article{arxiv.2303.01297,
title = {Creating Synthetic Datasets for Collaborative Filtering Recommender Systems using Generative Adversarial Networks},
author = {Jesús Bobadilla and Abraham Gutiérrez and Raciel Yera and Luis Martínez},
journal= {arXiv preprint arXiv:2303.01297},
year = {2023}
}