中文

LLMs-in-the-Loop 第2部分:面向多语言 PHI 匿名化与去标识化的专家小型 AI 模型

计算与语言 2024-12-17 v1 人工智能

摘要

慢性病和如新冠疫情等疫情的兴起凸显了在确保通过匿名化和去标识化受保护健康信息 (PHI) 的前提下有效处理患者数据的需求。匿名化数据可促进研究,同时不损害患者保密。本文介绍了使用 LLM-in-the-loop 方法开发的专家小型 AI 模型,以满足领域特定去标识命名实体识别 (NER) 模型的需求。这些模型通过消除通过 API 使用大型语言模型 (LLM) 时传输或存储敏感数据的隐私风险,克服了这一挑战。更重要的是,它们在去标识任务中一致优于 LLM,提供卓越的性能和可靠性。我们开发的去标识 NER 模型在八种语言(英语、德语、意大利语、法语、罗马尼亚语、土耳其语、西班牙语和阿拉伯语)中分别实现了 0.966、0.975、0.976、0.970、0.964、0.974、0.978 和 0.953 的 F1-micro 平均分。这些结果将其确立为最准确的医疗保健匿名化解决方案,超越现有的小型模型甚至通用 LLM 如 GPT-4o。本系列的第1部分介绍了 LLM-in-the-loop 方法用于生物医学文档翻译,而本第二部分展示了其在开发成本效益高的专家小型 NER 模型方面的成功。我们的发现为未来的医疗 AI 创新奠定了基础,包括生物医学实体和关系抽取,展示了专用模型针对领域特定挑战的价值。

关键词

引用

@article{arxiv.2412.10918,
  title  = {LLMs-in-the-Loop Part 2: Expert Small AI Models for Anonymization and De-identification of PHI Across Multiple Languages},
  author = {Murat Gunay and Bunyamin Keles and Raife Hizlan},
  journal= {arXiv preprint arXiv:2412.10918},
  year   = {2024}
}

备注

21 pages, 7 tables