面向代码混合临床文本粗粒度去标识的少样本跨语言迁移
计算与语言
2022-04-12 v1 密码学与安全
机器学习
摘要
尽管数字医疗系统提供精选结构化知识取得了进展,大量关键信息仍存在于海量未标注非结构化临床文本中。这些文本常含受保护健康信息(PHI),被暴露于信息抽取工具下面向下游应用,带来患者身份识别风险。现有去标识工作依赖使用英语大规模标注语料,其往往不适用于真实多语言场景。预训练语言模型(LM)已在低资源跨语言迁移中展现巨大潜力。本工作中,我们从经验上展示 LM 在命名实体识别(NER)上的少样本跨语言迁移特性,并将其应用于解决中风领域代码混合(西班牙语-加泰罗尼亚语)临床笔记去标识这一低资源真实挑战。我们标注了一个黄金评测数据集以评估少样本设定性能,其中仅使用数百标注样本训练。当从 MEDDOCAN(Marimon 等人,2019)语料用我们的少样本跨语言目标语料适配多语言 BERT(mBERT)(Devlin 等人,2019)时,模型在黄金评测集上的零样本 F1 分数从 73.7% 提升至 91.2%。泛化至样本外测试集时,最佳模型取得人工评测 F1 分数 97.2%。
引用
@article{arxiv.2204.04775,
title = {Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of Code-Mixed Clinical Texts},
author = {Saadullah Amin and Noon Pokaratsiri Goldstein and Morgan Kelly Wixted and Alejandro García-Rudolph and Catalina Martínez-Costa and Günter Neumann},
journal= {arXiv preprint arXiv:2204.04775},
year = {2022}
}
备注
Accepted by BioNLP'22