匿名性面临风险?评估大语言模型的再识别能力
计算与语言
2024-05-21 v2 人工智能
信息检索
机器学习
摘要
自然人与法人在法院判决中的匿名性是欧盟和瑞士隐私保护的关键方面。随着LLM的出现,关于对匿名化人员进行大规模再识别的担忧日益增长。根据瑞士联邦最高法院的立场,我们通过使用瑞士联邦最高法院的实际法律数据构建概念验证,探究LLM在法院判决中再识别个人的潜力。在初步实验之后,我们构建了一个匿名化的维基百科数据集作为更严格的测试平台,以进一步研究这些发现。随着重新识别文本中人物的新任务的引入与应用,我们也引入了衡量性能的新指标。我们系统分析了影响成功再识别的因素,确定模型规模、输入长度和指令微调是最关键的决定因素。尽管在维基百科上再识别率很高,但即便最优秀的LLM也难以处理法院裁决。这种复杂性归因于缺乏测试数据集、需要大量训练资源,以及用于再识别的信息存在数据稀疏性。总之,本研究表明使用LLM进行再识别目前或不可行,但正如维基百科上的概念验证所示,未来可能变得可行。我们希望我们的系统有助于增强对匿名化裁决安全性的信心,从而使法院更自信地发布裁决。
引用
@article{arxiv.2308.11103,
title = {Anonymity at Risk? Assessing Re-Identification Capabilities of Large Language Models},
author = {Alex Nyffenegger and Matthias Stürmer and Joel Niklaus},
journal= {arXiv preprint arXiv:2308.11103},
year = {2024}
}
备注
Accepted to NAACL Findings 2024