个人可识别信息识别的跨域迁移与少样本学习
计算与语言
2026-01-13 v3
摘要
准确识别个人可识别信息(PII)是自动文本匿名化的核心。本文研究了跨域模型迁移、多域数据融合和样本高效学习在PII识别中的有效性。使用来自医疗(I2B2)、法律(TAB)和传记(Wikipedia)等标注语料库,我们在四个维度上评估模型:域内性能、跨域可迁移性、融合效果和少样本学习。结果表明,法律域数据可良好迁移至传记文本,而医疗域则抵抗于传入迁移。融合效益具有域相关性,在低专业化域中仅需10%的训练数据即可实现高质量的识别。
引用
@article{arxiv.2507.11862,
title = {Cross-Domain Transfer and Few-Shot Learning for Personal Identifiable Information Recognition},
author = {Junhong Ye and Xu Yuan and Xinying Qiu},
journal= {arXiv preprint arXiv:2507.11862},
year = {2026}
}
备注
Accepted to CLNLP 2025