中文

MultiGraSCCo:面向多语言的匿名化基准数据集,标注了个人可识别信息

计算与语言 2026-03-17 v3

摘要

由于隐私顾虑,获取用于机器学习的敏感患者数据具有挑战性。标注了个人可识别信息的数据集对于开发和测试匿名化系统至关重要,以便在遵守隐私法规的前提下实现安全数据共享。由于获取真实患者数据是瓶颈,合成数据提供了高效的解决方案,克服了数据稀缺问题,绕开了适用于真实数据的隐私法规。此外,神经机器翻译有助于通过翻译来自高资源语言中经验证实数据或合成数据的,为低资源语言创建高质量数据。在本工作中,我们使用一种保持原始标注并使城市和人名在每个目标语言中在文化和语境上都恰当形式的机器翻译方法,构建了一个包含十种语言的多语言匿名化基准数据集。我们的医学专业人员评估研究确认了翻译的质量,包括翻译和适应个人信息方面的质量。我们包含超过 2500 条个人信息标注的基准数据集可用于许多应用,包括训练标注者、在无需法律麻烦的情况下跨机构验证标注,以及帮助提高自动个人信息检测的性能。我们将基准数据集和标注指南公开,以供进一步研究使用。

关键词

引用

@article{arxiv.2603.08879,
  title  = {MultiGraSCCo: A Multilingual Anonymization Benchmark with Annotations of Personal Identifiers},
  author = {Ibrahim Baroud and Christoph Otto and Vera Czehmann and Christine Hovhannisyan and Lisa Raithel and Sebastian Möller and Roland Roller},
  journal= {arXiv preprint arXiv:2603.08879},
  year   = {2026}
}

备注

Accepted at the International Conference on Language Resources and Evaluation (LREC2026)