GLiNER2-PII:一种用于个人身份信息提取的多语言模型
计算与语言
2026-05-12 v1 人工智能
摘要
在现代数据处理系统中,可靠地检测个人身份信息 (PII) 越来越重要,但该任务仍然困难:PII 跨度是异构的、依赖区域、对上下文敏感,且通常嵌入在嘈杂或半结构化的文档中。我们提出了 GLiNER2-PII,一个从 GLiNER2 改进而来的 0.3B 参数小模型,旨在识别字符跨度分辨率下 42 种 PII 实体类型的广泛分类体系。然而,训练此类系统受到可共享标注数据稀缺以及大规模收集真实 PII 带来的隐私风险的限制。为了应对这一挑战,我们使用约束驱动的生成管道构建了一个包含 4,910 篇标注文本的多语言合成语料库,该管道能够跨语言、领域、格式和实体分布生成多样且真实的样本。在具有挑战性的 SPY 基准上,GLiNER2-PII 在五个对比系统(包括 OpenAI Privacy Filter 和三个基于 GLiNER 的检测器)中取得了最高的跨度级 F1 分数。我们在 Hugging Face 上公开发布了该模型,以支持开放 PII 检测系统的进一步研究和实际部署。
引用
@article{arxiv.2605.09973,
title = {GLiNER2-PII: A Multilingual Model for Personally Identifiable Information Extraction},
author = {Urchade Zaratiana and Ash Lewis and George Hurn-Maloney},
journal= {arXiv preprint arXiv:2605.09973},
year = {2026}
}
备注
Under submission