中文

NoteContrast:面向医疗文本的对比式语言-诊断预训练

机器学习 2024-12-17 v1 计算与语言

摘要

医疗笔记的准确诊断编码对于提升医疗保健组织中的患者护理、医学研究和无差错计费至关重要。手动编码对医疗提供者而言是一项耗时的任务,且诊断代码通常表现出低敏感性和特异性,而医疗笔记中的自由文本可以更精确地描述患者状态。因此,医疗笔记的准确自动诊断编码已成为学习型医疗保健系统的关键。长文档 Transformer 架构的最新发展使得基于注意力的深度学习模型能够对医疗笔记进行裁定。此外,对比损失函数已被用于联合预训练带有噪声标签的大型语言和图像模型。为了进一步改进医疗笔记的自动裁定,我们开发了一种基于以下要素的方法:i) 使用大型真实世界数据集的 ICD-10 诊断代码序列模型;ii) 用于医疗笔记的大型语言模型;iii) 对比预训练,以构建 ICD-10 诊断代码与对应医疗文本的集成模型。我们证明,用于预训练的对比方法在 MIMIC-III-50、MIMIC-III-rare50 和 MIMIC-III-full 诊断编码任务上的性能优于先前最先进的模型。

关键词

引用

@article{arxiv.2412.11477,
  title  = {NoteContrast: Contrastive Language-Diagnostic Pretraining for Medical Text},
  author = {Prajwal Kailas and Max Homilius and Rahul C. Deo and Calum A. MacRae},
  journal= {arXiv preprint arXiv:2412.11477},
  year   = {2024}
}