自然语言处理中遵循隐私的机器遗忘
计算与语言
2022-12-20 v1
摘要
欧盟的《通用数据保护条例》(GDPR)或美国的《加州消费者隐私法案》(CCPA)等法规引入了关于“被遗忘权”的条款,要求行业应用从系统中删除与个人相关的数据。在许多使用机器学习基于用户数据构建模型的现实行业应用中,此类要求需要在数据清理和模型重训练方面付出巨大努力,同时确保模型不会因数据删除而降低预测质量。因此,如果这些应用以极高频率收到此类请求,持续的数据删除和模型重训练步骤将无法扩展。最近,一些研究人员提出了“机器遗忘”的概念来应对这一挑战。尽管这项任务具有重要意义,但机器遗忘领域在自然语言处理(NLP)任务中尚未得到充分探索。在本文中,我们在各种GLUE任务上探索了遗忘框架,例如QQP、SST和MNLI。我们提出了计算高效的(SISA-FC和SISA-A)方法来执行“有保证的”遗忘,与基线相比,在保持模型性能不变的同时,显著降低了内存(90-95%)、时间(100倍)和空间消耗(99%)。
引用
@article{arxiv.2212.09573,
title = {Privacy Adhering Machine Un-learning in NLP},
author = {Vinayshekhar Bannihatti Kumar and Rashmi Gangadharaiah and Dan Roth},
journal= {arXiv preprint arXiv:2212.09573},
year = {2022}
}