Textwash——自动化开源文本匿名化工具
计算与语言
2022-08-30 v1 计算机与社会
摘要
文本数据在社会科学研究中的使用日益增多,这得益于易于获取的数据(如 Twitter)。这一趋势的代价是研究需要敏感但难以共享的数据(如访谈数据、警方报告、电子健康记录)。我们借助开源文本匿名化软件 Textwash 引入了解决这一僵局的方案。本文使用 TILD 标准对该工具进行实证评估:技术评估(工具的准确性如何?)、信息损失评估(匿名化过程中损失了多少信息?)以及去匿名化测试(人类能否从匿名文本数据中识别个体?)。研究结果表明,Textwash 的性能类似于最先进的实体识别模型,并引入了 0.84% 的可忽略信息损失。在去匿名化测试中,我们让人类从众包人物描述数据集(包含非常著名、半著名和虚构个体)中按姓名识别个体。该工具在实际用例中的去匿名化率为 1.01%–2.01%。我们在第二项研究中复现了这些发现,并得出结论:Textwash 成功去除了可能敏感的、使详细人物描述实际上匿名的信息。
引用
@article{arxiv.2208.13081,
title = {Textwash -- automated open-source text anonymisation},
author = {Bennett Kleinberg and Toby Davies and Maximilian Mozes},
journal= {arXiv preprint arXiv:2208.13081},
year = {2022}
}