从文档到片段:基于大语言模型的 ICD 编码可扩展监督方法
计算与语言
2026-05-08 v2 人工智能
摘要
国际疾病分类(ICD)编码为临床文档分配诊断代码,是医疗保险和临床分析的必不可少的环节。可靠的编码要求每个预测代码都由明确的文本证据支持。然而,现有公开数据集仅提供代码标签,缺乏证据标注,限制了模型学习证据驱动预测的能力。本文认为,密集的文档级证据标注并非学习基于证据的编码所必需。相反,模型可以从局部片段中学习代码特定的证据模式,并用于支持文档级证据驱动的编码。基于这一洞见,我们提出了片段中心学习(Span-Centric Learning, SCL)框架,通过在片段水平强化大语言模型的编码能力,并将其推广至完整临床文档。具体而言,我们使用小规模标注文档监督证据识别、聚合和代码分配,同时利用大规模轻量级证据片段强化片段水平的推理。由于其紧凑性,片段标注具有可扩展性,还可通过合成进一步增强。我们在相同的 Llama3.1-8B 架构下,采用该方法的训练成本仅为标准完整人类学习(SFT)的 20%,即可实现宏观 F1 分数提升 8.2 分,并为每个预测代码提供明确的支持证据,使其可被人类审计和修订。
引用
@article{arxiv.2603.15270,
title = {From Documents to Spans: Scalable Supervision for Evidence-Based ICD Coding with LLMs},
author = {Xu Zhang and Wenxin Ma and Chenxu Wu and Rongsheng Wang and Zhiyang He and Xiaodong Tao and Kun Zhang and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2603.15270},
year = {2026}
}