解锁公共目录:面向德国肿瘤诊断的ICD编码指令微调大语言模型
计算与语言
2025-10-16 v1 人工智能
机器学习
摘要
准确编码德国肿瘤诊断的ICD-10-GM和ICD-O-3对于结构化癌症文档至关重要。较小的开源权重大语言模型(LLM)因其隐私保护优势而富有吸引力,但往往在德语语境下 struggles with coding accuracy。本研究探讨了是否通过针对公共数据集进行指令微调可提高开源权重LLM在德国肿瘤诊断文本ICD编码方面的准确率。评估使用来自当地肿瘤文档系统的编码诊断作为测试数据。在系统性数据质量评估中,估计了ICD-10编码性能的上限为60-79%(精确)和81-94%(部分仅三字符码)。作为训练数据,基于ICD-10-GM、ICD-O-3和OPS目录创建了超过50万个问答对。对来自Qwen、Llama和Mistral系列的8个开源权重模型(参数量为7-70亿)进行微调。ICD-10-GM准确率从1.4-24%提升至41-58%,部分准确率从31-74%提升至73-83%。ICD-O-3解剖位点编码的准确率也有所提高,但起点较低,微调后仍保持在22-40%(精确)和56-67%(部分)之间。错误代码输出降至0%。肿瘤诊断识别率达到99%。准确率与模型规模正相关,但微调后小模型与大模型之间的差距缩小。Qwen3的推理模式通常不如微调,且慢过100倍。我们的发现凸显了利用公共目录构建指令数据集以提升LLM在医学文档任务中表现的潜力。完整的训练数据集和最佳微调模型检查点均可在https://huggingface.co/datasets/stefan-m-lenz/ICDOPS-QA-2024 获取。
引用
@article{arxiv.2510.13624,
title = {Unlocking Public Catalogues: Instruction-Tuning LLMs for ICD Coding of German Tumor Diagnoses},
author = {Stefan Lenz and Lakisha Ortiz Rosario and Georg Vollmar and Arsenij Ustjanzew and Fatma Alickovic and Thomas Kindler and Torsten Panholzer},
journal= {arXiv preprint arXiv:2510.13624},
year = {2025}
}
备注
19 pages, 4 figures