中文

个人可识别信息识别的跨域迁移与少样本学习

计算与语言 2026-01-13 v3

摘要

准确识别个人可识别信息(PII)是自动文本匿名化的核心。本文研究了跨域模型迁移、多域数据融合和样本高效学习在PII识别中的有效性。使用来自医疗(I2B2)、法律(TAB)和传记(Wikipedia)等标注语料库,我们在四个维度上评估模型:域内性能、跨域可迁移性、融合效果和少样本学习。结果表明,法律域数据可良好迁移至传记文本,而医疗域则抵抗于传入迁移。融合效益具有域相关性,在低专业化域中仅需10%的训练数据即可实现高质量的识别。

关键词

引用

@article{arxiv.2507.11862,
  title  = {Cross-Domain Transfer and Few-Shot Learning for Personal Identifiable Information Recognition},
  author = {Junhong Ye and Xu Yuan and Xinying Qiu},
  journal= {arXiv preprint arXiv:2507.11862},
  year   = {2026}
}

备注

Accepted to CLNLP 2025