人与机器:大语言模型时代文本匿名化的有效性之争
密码学与安全
2023-03-23 v1
摘要
在当今数据驱动的文化中,个人数据的收集与使用愈发普遍。尽管这带来诸多优势,包括更好的决策与服务交付,但也引发了围绕保密与隐私的重大伦理问题。文本匿名化试图在保持剩余内容完整的同时,修剪和/或遮蔽文本中的可识别信息,以缓解隐私担忧。文本匿名化在医疗、法律以及研究等行业尤为重要,这些行业在高法律与伦理标准下收集、处理和交换敏感及个人信息。尽管文本匿名化在实践中被广泛采用,仍面临显著挑战。最重大的挑战在于平衡移除信息以保护个人隐私与保持文本未来用途可用性之间的关系。问题在于这些匿名化方法是否充分降低了再识别风险,即个体可基于文本中剩余信息被识别。本工作中,我们质疑这些方法的有效性以及我们对标识符的认知。我们针对房间中的大象——AI 在大数据上的应用——评估这些方法的有效性。尽管多数研究聚焦于识别并移除个人信息,关于剩余信息是否足以对个体去匿名化、更确切地说谁能够做到这一点,讨论有限。为此,我们使用 GPT 对名人的匿名化文本进行实验,以确定此类训练网络能否对他们去匿名化。后者使我们得以修订这些方法,并引入一种利用大语言模型(LLM)提升文本匿名性的新方法。
引用
@article{arxiv.2303.12429,
title = {Man vs the machine: The Struggle for Effective Text Anonymisation in the Age of Large Language Models},
author = {Constantinos Patsakis and Nikolaos Lykousas},
journal= {arXiv preprint arXiv:2303.12429},
year = {2023}
}