中文

CLiGNet:用于临床传记的临床标签交互图网络

人工智能 2026-03-25 v1

摘要

将临床传记自动分类到医学 specialty 以实现路由、编码和临床决策支持至关重要,但以MTSamples基准进行的先前工作因在训练测试划分之前应用SMOTE过采样而导致严重的数据泄露。 我们首先记录了这一方法论缺陷,并在40个医学 specialty (4966条记录) 上建立了一个无数据泄露的基准,揭示真实任务难度显著高于此前报告的水平。随后,我们引入CLiGNet (Clinical Label Interaction Graph Network),一种结合Bio ClinicalBERT文本编码器与两层图卷积网络的神经架构,后者在由语义相似性和ICD 10章节先验构建的specialty标签图上运行。 每个标签注意力门融合文档和标签图表示,采用焦点二进制交叉熵损失以处理极端类别不平衡 (181:1)。 在TF-IDF分类器到Clinical Longformer等七个基准上,CLiGNet在无校准情况下实现最高的宏F1值0.279,通过ablation研究确认GCN标签图提供了单最大的组件增益 (宏F1提升0.066)。 添加每个标签的Platt scaling校准可实现预期校准误差为0.007,展示了在排序性能和概率可靠性之间原则性的权衡。 我们提供了全面的失败分析,涵盖成对的specialty混淆、稀有类的行为、文档长度效应和token级别的集成梯度归因,为临床NLP系统部署提供可操作的见解。

关键词

引用

@article{arxiv.2603.22752,
  title  = {CLiGNet: Clinical Label-Interaction Graph Network for Medical Specialty Classification from Clinical Transcriptions},
  author = {Pronob Kumar Barman and Pronoy Kumar Barman},
  journal= {arXiv preprint arXiv:2603.22752},
  year   = {2026}
}