中文

评估语言模型中的隐私风险:以摘要任务为例

计算与语言 2023-10-23 v1 人工智能 机器学习

摘要

大语言模型通过在各项任务上取得最先进性能而革新了NLP领域。然而,存在一种担忧,即这些模型可能泄露训练数据中的信息。在本研究中,我们聚焦于摘要任务,并考察成员推断(MI)攻击:给定样本以及对模型API的黑盒访问权限,可判定该样本是否属于训练数据。我们利用文本相似度及模型对文档修改的抗性作为潜在的MI信号,并在广泛使用的数据集上评估其有效性。我们的结果表明,摘要模型面临暴露数据成员身份的风险,即便在参考摘要不可用的情况下亦然。此外,我们讨论了训练摘要模型以抵御MI攻击的若干防护措施,并探讨了隐私与效用之间的固有权衡。

关键词

引用

@article{arxiv.2310.13291,
  title  = {Assessing Privacy Risks in Language Models: A Case Study on Summarization Tasks},
  author = {Ruixiang Tang and Gord Lueck and Rodolfo Quispe and Huseyin A Inan and Janardhan Kulkarni and Xia Hu},
  journal= {arXiv preprint arXiv:2310.13291},
  year   = {2023}
}