展开式自重构 LSH:面向近似最近邻搜索中的机器遗忘
信息检索
2023-04-07 v2
摘要
近似最近邻(ANN)搜索是搜索引擎、推荐系统等的重要组成部分。许多近期工作聚焦于基于学习的数据分布相关哈希并取得了良好检索性能。然而,由于对用户隐私与安全的需求日益增长,我们常需从机器学习(ML)模型中移除用户数据信息以满足特定隐私与安全要求。这一需求要求 ANN 搜索算法支持快速的在线数据删除与插入。当前基于学习的哈希方法需要重新训练哈希函数,因大规模数据的巨大时间成本而不可行。为解决该问题,我们提出一种名为展开式自重构局部敏感哈希(USR-LSH)的新型数据相关哈希方法。我们的 USR-LSH 展开了用于实例级数据重构的优化更新,相比数据无关 LSH 更利于保留数据信息。此外,我们的 USR-LSH 支持无需重训练的快速在线数据删除与插入。据我们所知,我们首个解决了检索问题的机器遗忘。在经验上,我们证明 USR-LSH 在精度和召回率方面优于最先进的分布无关 LSH(数据分布独立 LSH)于 ANN 任务。我们也展示 USR-LSH 的数据删除与插入时间显著快于基于学习的数据相关哈希。
引用
@article{arxiv.2304.02350,
title = {Unfolded Self-Reconstruction LSH: Towards Machine Unlearning in Approximate Nearest Neighbour Search},
author = {Kim Yong Tan and Yueming Lyu and Yew Soon Ong and Ivor W. Tsang},
journal= {arXiv preprint arXiv:2304.02350},
year = {2023}
}
备注
correct author's name typo