中文

PIIBench:用于个人可识别信息检测的统一多来源基准语料库

计算与语言 2026-04-20 v1 人工智能

摘要

我们提出PIIBench,一个用于自然语言文本中个人可识别信息(PII)检测的统一基准语料库。现有针对PII检测的资源在领域特定语料库中碎片化,标注方案彼此不兼容,阻碍了检测系统的系统性比较。我们整合了十个公开可得的数据集,涵盖合成PII语料库、多语言命名实体识别(NER)基准以及金融领域标注文本,构建含2,369,883个标注序列和335万个实体mention,覆盖48种规范PII实体类型。我们发展了原则性的归一化管道,将80多种来源特定标签映射到标准BIO标注方案,应用频率基准抑制稀缺实体类型,并生成保持源分布的分层80/10/10训练/验证/测试划分。为建立基准难度,我们评估了八个已发布系统:基于规则引擎(Microsoft Presidio)、通用NER模型(spaCy、BERT-base NER、XLM-RoBERTa NER、SpanMarker mBERT、SpanMarker BERT)、PII专用模型(Piiranha DeBERTa)以及金融NER专家(XtremeDistil FiNER)。所有系统的跨度级F1分数均低于0.14,最佳系统(Presidio,F1=0.1385)在大多数实体类型上仍实现零召回率。这些结果直接量化了领域孤岛问题,表明PIIBench比任何现有单一来源PII数据集都更具挑战性和更全面的评估价值。数据集构建管道和基准评估代码已公开于https://github.com/pritesh-2711/pii-bench。

关键词

引用

@article{arxiv.2604.15776,
  title  = {PIIBench: A Unified Multi-Source Benchmark Corpus for Personally Identifiable Information Detection},
  author = {Pritesh Jha},
  journal= {arXiv preprint arXiv:2604.15776},
  year   = {2026}
}