基于检索的语言模型的隐私影响
计算与语言
2023-05-25 v1 密码学与安全
机器学习
摘要
基于检索的语言模型(LMs)通过融入从外部数据存储中检索的文本,相比其参数化对应模型展现出更好的可解释性、事实性与适应性。尽管众所周知参数化模型易于泄露隐私数据,但添加检索数据存储如何影响模型隐私仍不清楚。本文首次研究基于检索的LMs(特别是NN-LMs)中的隐私风险。我们的目标是在隐私受关注的领域中探索最优设计与训练流程,以在效用与隐私间取得平衡。关键的是,我们发现NN-LMs比参数化模型更容易从其私有数据存储泄露隐私信息。我们进一步探索隐私风险的缓解方法。当隐私信息在文本中被针对性地轻易检测时,我们发现简单的清洗步骤可完全消除风险,而解耦查询与键编码器可实现更好的效用-隐私权衡。否则,我们考虑在数据存储与编码器训练中混合公开与私有数据的策略。尽管这些方法带来一定改进,仍留有相当大的未来工作空间。综上,我们的发现为实践者更好地理解并缓解基于检索的LMs中的隐私风险提供了见解。我们的代码见:https://github.com/Princeton-SysML/kNNLM_privacy。
引用
@article{arxiv.2305.14888,
title = {Privacy Implications of Retrieval-Based Language Models},
author = {Yangsibo Huang and Samyak Gupta and Zexuan Zhong and Kai Li and Danqi Chen},
journal= {arXiv preprint arXiv:2305.14888},
year = {2023}
}