稀有 ICD 编码的合成临床笔记:面向长尾医学编码的数据中心框架
计算与语言
2025-11-19 v1 人工智能
摘要
从临床文本自动编码是医学 NLP 的关键任务,但因诊断代码的极端长尾分布,仍面临挑战。大量稀有与零样本 ICD 编码在 MIMIC-III 等数据集中严重不足,导致宏观 F1 分数偏低。本文提出一种数据中心框架,通过生成高质量的合成出院病程笔记来缓解此不平衡。方法通过利用真实共现模式、ICD 描述、同义词、分类学结构及相似临床笔记,构建以稀有编码为锚点的现实多标签代码集合。利用这些结构化提示生成 90,000 份合成笔记,覆盖 7,902 个 ICD 编码,显著扩充训练分布。我们在原数据集与扩展数据集上对两种最新 Transformer 基模型 PLM-ICD 与 GKI-ICD 进行微调。实验表明,我们的方法在宏观 F1 分数上略有提升,同时保持强劲的微观 F1,超越了 prior SOTA。尽管提升幅度看似有限,但结果表明,精心构建的合成数据可提升长尾 ICD 编码预测的公平性。
引用
@article{arxiv.2511.14112,
title = {Synthetic Clinical Notes for Rare ICD Codes: A Data-Centric Framework for Long-Tail Medical Coding},
author = {Truong Vo and Weiyi Wu and Kaize Ding},
journal= {arXiv preprint arXiv:2511.14112},
year = {2025}
}
备注
4 page-short paper