中文

GPT-3.5 能生成和编码出院小结吗?

计算与语言 2024-09-17 v2

摘要

目的:研究 GPT-3.5 在生成医疗文档并使用 ICD-10 代码进行编码方面的能力,以用于低资源标签的数据增强。材料与方法:采用 GPT-3.5,我们根据 MIMIC-IV 数据集中具有不常见(生成)代码的患者的 ICD-10 代码描述列表,生成并编码了 9,606 份出院小结。将其与基线训练集结合,形成增强训练集。在基线和增强数据上训练神经编码模型,并在 MIMIC-IV 测试集上进行评估。我们报告了完整代码集、生成代码及其家族的 micro-F1 和 macro-F1 分数。在后者的代码集中,采用弱分层混淆矩阵来确定家族内和家族外的编码错误。GPT-3.5 的编码性能在提示引导的自生成数据和真实 MIMIC-IV 数据上均进行了评估。临床专业人员评估了生成文档的临床可接受性。结果:增强略微阻碍了模型的整体性能,但提高了生成候选代码及其家族的性能,包括在基线训练数据中未见过的一个代码。增强模型显示出较低的家族外错误率。GPT-3.5 能够通过提示描述识别 ICD-10 代码,但在真实数据上表现不佳。评估者指出生成概念的正确性,但在多样性、支持信息和叙述方面存在不足。讨论与结论:单独使用 GPT-3.5 不适用于 ICD-10 编码。增强对生成代码家族产生积极影响,但主要使具有现有示例的代码受益。增强减少了家族外错误。GPT-3.5 生成的出院小结正确陈述了提示概念,但缺乏多样性以及叙述的真实性。它们不适用于临床实践。

关键词

引用

@article{arxiv.2401.13512,
  title  = {Can GPT-3.5 Generate and Code Discharge Summaries?},
  author = {Matúš Falis and Aryo Pradipta Gema and Hang Dong and Luke Daines and Siddharth Basetti and Michael Holder and Rose S Penfold and Alexandra Birch and Beatrice Alex},
  journal= {arXiv preprint arXiv:2401.13512},
  year   = {2024}
}

备注

15 pages; 250 words in abstract; 4,152 words in main body; 4 figures (1 black and white, 3 colour); 4 tables; 34 references; Accepted and published by the Journal of the American Medical Informatics Association