以两阶段方法超越 GPT-4 医疗编码
计算与语言
2023-11-27 v1
摘要
大语言模型(LLM)的最新进展显示了其在临床应用中的潜力,例如临床决策支持和试验推荐。然而,GPT-4 LLM 在医疗编码任务中预测了过多的 ICD 代码,导致高召回率但低精确率。为应对这一挑战,我们引入了 LLM-codex,一种预测 ICD 代码的两阶段方法,该方法首先使用 LLM 生成证据提案,然后采用基于 LSTM 的验证阶段。LSTM 通过自定义损失函数从 LLM 的高召回率和人类专家的高精确率中学习。根据在 MIMIC 数据集上的实验,我们的模型是唯一一种同时在医疗编码准确性、罕见代码准确性以及支持编码决策的句级证据识别方面达到最先进结果的方法,且无需在人工标注证据上训练。
引用
@article{arxiv.2311.13735,
title = {Surpassing GPT-4 Medical Coding with a Two-Stage Approach},
author = {Zhichao Yang and Sanjit Singh Batra and Joel Stremmel and Eran Halperin},
journal= {arXiv preprint arXiv:2311.13735},
year = {2023}
}
备注
Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2023, December 10th, 2023, New Orleans, United States, 19 pages