中文

RedactOR:基于大语言模型的自动临床数据去标识化框架

人工智能 2025-07-28 v2 机器学习

摘要

在保留数据效用的同时确保临床数据隐私,对于AI驱动的医疗和数据分析至关重要。现有的去标识化(De-ID)方法,包括基于规则的技术、深度学习模型和大语言模型(LLMs),常常受到召回错误、泛化能力有限和效率低下等问题的影响,限制了其实际应用。我们提出了一种完全自动化的多模态框架RedactOR,用于对结构化和非结构化电子健康记录(包括临床音频记录)进行去标识化。我们的框架采用高效的去标识化策略,包括智能路由、混合规则与LLM方法以及两步音频编辑方法。我们提出了一种基于检索的实体重词汇化方法,以确保受保护实体的一致替换,从而增强下游应用的数据一致性。我们讨论了RedactOR的关键设计需求、去标识化与重词汇化方法论及其模块化架构,以及其与Oracle Health Clinical AI系统的集成。在i2b2 2014 De-ID数据集上使用标准指标以严格召回率进行评估,我们的方法在优化token使用以降低LLM成本的同时取得了具有竞争力的性能。最后,我们讨论了在实际AI驱动的医疗数据流水线中部署的关键经验与见解。

关键词

引用

@article{arxiv.2505.18380,
  title  = {RedactOR: An LLM-Powered Framework for Automatic Clinical Data De-Identification},
  author = {Praphul Singh and Charlotte Dzialo and Jangwon Kim and Sumana Srivatsa and Irfan Bulu and Sri Gadde and Krishnaram Kenthapadi},
  journal= {arXiv preprint arXiv:2505.18380},
  year   = {2025}
}

备注

Accepted to ACL 2025 Industry Track. To appear