中文

致匿名与高效性:量化匿名方法的效率与通用性

计算与语言 2026-02-19 v1

摘要

大型语言模型在临床匿名化方面表现突出,即识别敏感标识符以保护隐私。然而,先前的研究未检视这些方法在不同格式、文化和性别之间的通用性。本文系统评估了微调的变换模型(BERT、ClinicalBERT、ModernBERT)、小型 LLM(Llama 1-8B、Qwen 1.5-7B)和大型 LLM(Llama-70B、Qwen-72B)在匿名化任务中的表现。我们展示了小型模型在保持可comparable性能的同时显著降低了推理成本,使其更适用于实际部署。此外,我们证明了小型模型可通过有限数据进行微调,以在识别来自中文、印地语、西班牙语、法语、孟加拉语和英语地区变体,以及性别化姓名等标识符时超越大型模型。为提升多文化情境下的鲁棒性,我们引入并公开发布了 BERT-MultiCulture-DEID,这是一套基于 BERT、ClinicalBERT 和 ModernBERT 的匿名化模型,这些模型在 MIMIC 数据集上进行了微调,涵盖多种语言变体的标识符。我们的发现首次系统量化了匿名化效率与通用性之间的权衡,并为公平且高效的临床匿名化提供了实际路径。模型获取详情请参见:https://doi.org/10.5281/zenodo.18342291

关键词

引用

@article{arxiv.2602.15869,
  title  = {Towards Fair and Efficient De-identification: Quantifying the Efficiency and Generalizability of De-identification Approaches},
  author = {Noopur Zambare and Kiana Aghakasiri and Carissa Lin and Carrie Ye and J. Ross Mitchell and Mohamed Abdalla},
  journal= {arXiv preprint arXiv:2602.15869},
  year   = {2026}
}

备注

Accpted to the Findings of EACL 2026