推荐系统遗忘
信息检索
2022-01-26 v2 机器学习
摘要
推荐系统通过学习从收集数据中获取的用户个人偏好,提供必需的 Web 服务。然而在许多情况下,系统也需要遗忘部分训练数据。从隐私角度看,近期提出了若干隐私法规,要求系统消除其所有者请求遗忘的数据的任何影响。从效用角度看,若系统效用被某些不良数据损害,系统需遗忘这些数据以恢复效用。从可用性角度看,用户可删除噪声与错误条目,使系统提供更有效的推荐。尽管遗忘十分重要,现有推荐系统尚未充分考虑该问题。虽有研究在图像与文本数据领域探讨机器遗忘问题,现有方法无法直接应用于推荐,因其无法考虑协同信息。本文提出 RecEraser,一种面向推荐任务的通用的高效机器遗忘框架。RecEraser 的核心思想是将训练集划分为多个分片并为每个分片训练一个组成模型。具体地,为保持数据的协同信息,我们首先设计三种新颖的数据划分算法,依据相似性将训练数据划分为均衡的组。进而,考虑到不同分片模型对最终预测的贡献并不均匀,我们进一步提出自适应聚合方法以提升全局模型效用。在三个公开基准上的实验结果表明,RecEraser 不仅能实现高效遗忘,且在模型效用上优于最先进的遗忘方法。源代码见 https://github.com/chenchongthu/Recommendation-Unlearning
引用
@article{arxiv.2201.06820,
title = {Recommendation Unlearning},
author = {Chong Chen and Fei Sun and Min Zhang and Bolin Ding},
journal= {arXiv preprint arXiv:2201.06820},
year = {2022}
}
备注
To appear in TheWebConf 2022