手术账单与编码的生成式 AI 应用:实用设计与基准测试
计算与语言
2025-01-13 v1 机器学习
摘要
背景:医疗保健领域存在许多手工流程,可通过生成式人工智能进行自动化和增强,医疗账单和编码process。然而,当前的基础大型语言模型(LLM)在生成准确的国际疾病分类第 10 版临床修订版(ICD-10-CM)和当前程序术语(CPT)代码时表现不佳。此外,在医疗保健领域应用生成式 AI 还面临诸多安全和财务挑战。我们提出了一种开发医疗账单和编码生成式 AI 工具的策略,在准确性、可访问性和患者隐私之间进行平衡。方法:我们使用机构数据对 PHI-3 Mini 和 PHI-3 Medium LLM 进行微调,并将结果与 PHI-3 base 模型、PHI-3 RAG 应用和 GPT-4o 进行比较。我们使用术后外科报告作为输入, patients 的账单索赔作为目标结果,其关联的 ICD-10、CPT 和 Modifier 代码。用代码生成准确率、无效代码比例和账单索赔格式的忠实度衡量性能。结果:两者微调的模型表现良好,甚至优于 GPT-4o。Phi-3 Medium 微调模型表现最佳(ICD-10 Recall 和 Precision: 72%,72%;CPT Recall 和 Precision: 77%,79%;Modifier Recall 和 Precision: 63%,64%)。Phi-3 Medium 微调模型仅生成 1% 的 ICD-10 代码和 0.6% 的 CPT 代码。结论:我们的研究表明,针对特定任务使用特定领域数据的微调小型模型,仅需简单的一套开源工具和最小的技术和经济要求,便能表现良好。
引用
@article{arxiv.2501.05479,
title = {Practical Design and Benchmarking of Generative AI Applications for Surgical Billing and Coding},
author = {John C. Rollman and Bruce Rogers and Hamed Zaribafzadeh and Daniel Buckland and Ursula Rogers and Jennifer Gagnon and Ozanan Meireles and Lindsay Jennings and Jim Bennett and Jennifer Nicholson and Nandan Lad and Linda Cendales and Andreas Seas and Alessandro Martinino and E. Shelley Hwang and Allan D. Kirk},
journal= {arXiv preprint arXiv:2501.05479},
year = {2025}
}
备注
21 pages, 3 figures, 2 tables