中文

面向推荐系统的隐私保护合成数据生成

信息检索 2022-09-28 v1

摘要

推荐系统主要基于用户的历史交互数据(例如先前点击或购买的物品)进行预测。在收集用户行为数据以构建推荐模型时存在隐私泄露风险。然而,现有的隐私保护方案仅针对模型训练和结果收集阶段的隐私问题设计。当直接将私有用户交互数据共享给组织或公开发布时,隐私泄露问题仍然存在。为解决该问题,本文提出一种用户隐私可控合成数据生成模型(简称UPC-SDG),其基于用户的隐私偏好为用户生成合成交互数据。该生成模型旨在在数据层和物品层提供一定的隐私保证,同时最大化生成合成数据的效用。具体而言,在数据层,我们设计了一个选择模块,从用户交互数据中筛选那些对用户偏好贡献较小的物品。在物品层,提出一种合成数据生成模块,基于用户偏好为所选物品生成对应的合成物品。此外,我们还提出了一种隐私-效用权衡策略,以平衡合成数据的隐私和效用。我们在三个公开数据集上进行了大量实验和消融研究来验证我们的方法,证明了其在用户隐私偏好下生成合成数据的有效性。

关键词

引用

@article{arxiv.2209.13133,
  title  = {Privacy-Preserving Synthetic Data Generation for Recommendation Systems},
  author = {Fan Liu and Zhiyong Cheng and Huilin Chen and Yinwei Wei and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2209.13133},
  year   = {2022}
}

备注

ACM SIGIR Conference on Research and Development in Information Retrieval(SIGIR' 22)