利用伪数据增强临床模型的去标识化
计算与语言
2025-06-18 v2
摘要
许多模型出于隐私原因在脱敏文本上进行预训练。临床基础模型通常使用特殊语法(掩码)文本替代受保护的健康信息进行训练。尽管这些模型日益普及,但很少有人努力理解在脱敏文本上训练它们的效果。在这项工作中,我们在包含脱敏文本的数据集以及用真实伪文本替换后的版本上预训练了若干仅编码器模型。然后,我们针对受保护健康信息去标识化任务对这些模型进行微调,并展示了我们的方法如何显著优于先前基线。本工作的贡献包括:a) 我们的新颖且令人惊讶的发现与训练建议,b) 用于生成伪数据集的脱敏文本替换方法,c) 预训练嵌入和微调的任务特定模型,以及 d) 公开可用的伪训练数据集生成和模型源代码。
引用
@article{arxiv.2506.12674,
title = {Enhancing Clinical Models with Pseudo Data for De-identification},
author = {Paul Landes and Aaron J Chaise and Tarak Nath Nandi and Ravi K Madduri},
journal= {arXiv preprint arXiv:2506.12674},
year = {2025}
}