面向多语言PII检测的混合方法评估研究
人工智能
2025-10-10 v1
摘要
个人可识别信息(PII)的检测对于隐私合规性至关重要,但在低资源语言环境中由于语言多样性和有限的标注数据,仍面临挑战。我们提出RECAP,一种混合框架,结合确定性正则表达式与上下文感知的大型语言模型(LLM),实现对13种低资源语言环境中PII的可扩展检测。RECAP的模块化设计支持超过300种实体类型,无需重新训练,采用三阶段细化流程进行消歧和过滤。我们使用nervaluate进行基准测试,RECAP在加权F1分数上比微调的命名实体识别模型高出82%,比零样本LLM高出17%。本工作提供了一种高效且可适应的解决方案,用于合规性应用中的PII检测。
引用
@article{arxiv.2510.07551,
title = {An Evaluation Study of Hybrid Methods for Multilingual PII Detection},
author = {Harshit Rajgarhia and Suryam Gupta and Asif Shaik and Gulipalli Praveen Kumar and Y Santhoshraj and Sanka Nithya Tanvy Nishitha and Abhishek Mukherji},
journal= {arXiv preprint arXiv:2510.07551},
year = {2025}
}