中文

使用隐私保护合成临床数据训练面向医学编码的大语言模型

计算与语言 2026-03-26 v1 人工智能

摘要

提高医学编码的准确性和可靠性可减轻临床医生的负担,支持收费管理流程,使医生能够更专注于患者护理。然而,自动从临床文档分配 ICD-10-CM 和 CPT 编码仍是一个挑战,due to 病历的异构性、编码指南的细微差异以及长尾分布。大语言模型被提议用于帮助或自动完成特定医学编码任务。然而,基础模型未针对医学编码进行显式训练,零样本编码结果不佳。我们研究了现代开源权重基础模型能否通过源自电子健康记录(EHR)的隐私保护合成训练数据适用于专家水平的医学编码任务。我们对 Llama 3-70B 在由 EHR grounding 模板和编码政策生成的临床笔记与金标代码配对的数据集上进行微调,然后评估 ICD-10-CM 和 CPT 的精确编码预测。零样本基线(未适配模型)实现了 0.18 的 F1 分数。经过合成语料微调后,精确匹配 F1 超过 0.70,两个编码系统均实现了显著提升。值得注意的是,在需要多步临床推理和编码组合的复杂类别(包括 Advanced Illness and Frailty 类)上性能仍保持良好,模型也保留了在医学理解任务上的性能。这些结果表明,合成且政策感知的数据可高效教导通用大语言模型支持精准医学编码,而无需暴露受保护的健康信息。该方法为在特定任务中安全且可迭代地训练编码代理提供了实用路径。

关键词

引用

@article{arxiv.2603.23515,
  title  = {Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data},
  author = {John Cook and Michael Wyatt and Peng Wei and Iris Chin and Santosh Gupta and Van Zyl Van Vuuren and Richie Siburian and Amanda Spicer and Kristen Viviano and Alda Cami and Raunaq Malhotra and Zhewei Yao and Jeff Rasley and Gaurav Kaushik},
  journal= {arXiv preprint arXiv:2603.23515},
  year   = {2026}
}

备注

20 pages, 6 figures