中文

模型选择结合临床语义:通过 LLM-as-Judge 评估、冗余感知采样与分节微调优化 ICD-10-CM 预测

人工智能 2025-09-24 v1

摘要

准确的国际疾病分类(ICD)编码对于临床文档记录、计费和医疗分析至关重要,但这仍是一项劳动密集且易出错的任务。尽管大语言模型(LLM)在自动化 ICD 编码方面展现出潜力,但其在基础模型选择、输入上下文化以及训练数据冗余方面的挑战限制了其有效性。我们提出了一个用于 ICD-10 临床修改(ICD-10-CM)代码预测的模块化框架,通过有原则的模型选择、冗余感知数据采样和结构化输入设计来应对这些挑战。该框架集成了 LLM-as-judge 评估协议与 Plackett-Luce 聚合,以根据开源 LLM 对 ICD-10-CM 代码定义的内在理解来评估和对其进行排名。我们引入了基于嵌入的相似性度量,这是一种用于去除语义重复出院摘要的冗余感知采样策略。我们利用来自台湾医院的结构化出院摘要来评估上下文效应,并检验在通用建模和特定分节建模范式下的分节内容包含情况。在两个机构数据集上的实验表明,经过微调后选定的基础模型在内部和外部评估中均持续优于基线 LLM。纳入更多临床分节可持续提升预测性能。本研究使用开源 LLM,为 ICD-10-CM 代码预测确立了一种实用且有原则的方法。所提出的框架结合了有依据的模型选择、高效的数据精炼和上下文感知提示,为自动化医疗编码系统的实际部署提供了可扩展、即装即用的解决方案。

关键词

引用

@article{arxiv.2509.18846,
  title  = {Model selection meets clinical semantics: Optimizing ICD-10-CM prediction via LLM-as-Judge evaluation, redundancy-aware sampling, and section-aware fine-tuning},
  author = {Hong-Jie Dai and Zheng-Hao Li and An-Tai Lu and Bo-Tsz Shain and Ming-Ta Li and Tatheer Hussain Mir and Kuang-Te Wang and Min-I Su and Pei-Kang Liu and Ming-Ju Tsai},
  journal= {arXiv preprint arXiv:2509.18846},
  year   = {2025}
}

备注

28 Pages, 4 Figures, 2 Tables