使用大语言模型对历史死亡原因数据进行编码
机器学习
2024-05-14 v1
摘要
本文研究了使用预训练的生成式大语言模型(LLM)来自动为历史死亡原因分配 ICD-10 编码的可行性。由于历史死亡原因常包含复杂叙述性文字,此任务传统上由编码专家手动完成。我们评估了 GPT-3.5、GPT-4 和 Llama 2 大语言模型在包含 19,361 名来自英国 Ipswich、Kilmarnock 和 Isle of Skye 市镇居民 1861-1901 年间公民死亡登记记录死亡原因的 HiCaD 数据集上准确分配 ICD-10 编码的能力。我们的发现表明,GPT-3.5、GPT-4 和 Llama 2 分别对死亡原因正确分配代码的比例为 69%、83% 和 40%。然而,通过标准机器学习技术可实现最高达 89% 的准确率。所有 LLM 对包含今天仍在使用的术语的死亡原因表现得更好,而对古老术语的表现较差。它们也对较短的死亡原因(1-2 个词)表现得更好。因此,LLM 目前在历史 ICD-10 编码分配任务中表现不足。我们建议进一步微调或采用其他框架以实现更好的性能。
引用
@article{arxiv.2405.07560,
title = {Coding historical causes of death data with Large Language Models},
author = {Bjørn Pedersen and Maisha Islam and Doris Tove Kristoffersen and Lars Ailo Bongo and Eilidh Garrett and Alice Reid and Hilde Sommerseth},
journal= {arXiv preprint arXiv:2405.07560},
year = {2024}
}
备注
18 pages, 1 figure in main text, 3 figures in appendix