中文

DeID-GPT:基于 GPT-4 的零样本医学文本去标识化

计算与语言 2025-12-02 v3 计算机与社会

摘要

医疗数字化促进了医疗数据的共享与重用,但也引发了保密与隐私方面的担忧。HIPAA(健康保险流通与责任法案)要求在传播医疗记录之前移除可重新识别的信息。因此,亟需有效且高效的医疗数据去标识化解决方案,尤其是针对自由文本形式的方案。尽管先前实践中已开发并使用了多种计算机辅助去标识化方法(包括基于规则和基于学习的),此类方案仍缺乏泛化能力或需根据不同场景微调,极大限制了其更广泛应用。大语言模型(LLM)如 ChatGPT 和 GPT-4 的发展,已展现出以零样本上下文学习处理医学领域文本数据的巨大潜力,尤其在隐私保护任务中,因为这些模型可凭借其强大的命名实体识别(NER)能力识别机密信息。本工作中,我们开发了一种新颖的 GPT-4 赋能去标识化框架("DeID-GPT"),以自动识别并移除标识信息。与现有常用医学文本数据去标识化方法相比,我们开发的 DeID-GPT 在非结构化医学文本中遮蔽隐私信息时表现出最高准确率和卓越可靠性,同时保留文本原始结构与含义。本研究是最早利用 ChatGPT 和 GPT-4 进行医学文本数据处理与去标识化的工作之一,为进一步研究和开发 LLM(如 ChatGPT/GPT-4)在医疗中的使用提供了见解。代码和基准数据信息见 https://github.com/yhydhx/ChatGPT-API。

关键词

引用

@article{arxiv.2303.11032,
  title  = {DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4},
  author = {Zhengliang Liu and Yue Huang and Xiaowei Yu and Lu Zhang and Zihao Wu and Chao Cao and Haixing Dai and Lin Zhao and Yiwei Li and Peng Shu and Fang Zeng and Lichao Sun and Wei Liu and Dinggang Shen and Quanzheng Li and Tianming Liu and Dajiang Zhu and Xiang Li},
  journal= {arXiv preprint arXiv:2303.11032},
  year   = {2025}
}