用于真实推荐系统评估的多样化合成数据集生成
信息检索
2024-12-11 v1 人工智能
摘要
合成数据集对于评估和测试机器学习模型至关重要。在评估真实推荐系统时,通常考虑高维类别型(且稀疏)的数据集。不幸的是,目前鲜有解决方案能够生成具有此类特征的人工数据集。为此,我们开发了一种用于生成多样且统计一致的合成数据集的新型框架。该框架允许创建具有可控属性的数据集,支持迭代修改以满足特定实验需求,例如引入复杂的特征交互、特征基数或特定分布。我们通过基准测试概率计数算法、检测算法偏差和模拟AutoML搜索等用例来展示该框架的效用。与现有方法要么聚焦于特定的数据集结构,要么优先通过真实数据进行(私有)数据合成不同,我们的方法提供了一种模块化手段,可以快速生成完全合成的数据集,并根据多样化的实验需求进行定制。我们的结果表明,该框架能够有效隔离模型在独特情境下的行为,并展示了其在推荐系统评估与开发中取得重大进展的潜力。该框架已作为免费开源的Python包发布,以最低门槛促进研究。
引用
@article{arxiv.2412.06809,
title = {Generating Diverse Synthetic Datasets for Evaluation of Real-life Recommender Systems},
author = {Miha Malenšek and Blaž Škrlj and Blaž Mramor and Jure Demšar},
journal= {arXiv preprint arXiv:2412.06809},
year = {2024}
}
备注
RecSys 2024'