中文

大型语言模型在医学术语分类中的应用及响应与推理之间的意外不一致性

计算与语言 2023-12-25 v1 人工智能 机器学习

摘要

本研究评估了包括 GPT-3.5、GPT-4、Falcon 和 LLaMA 2 在内的最先进大型语言模型 (LLM) 从出院小结中识别轻度认知障碍 (MCI) 患者的能力,并考察了模型响应与其推理不一致的情况。利用 MIMIC-IV v2.2 数据库,我们聚焦于 65 岁及以上的队列,对照 ICD 代码和专家评估验证 MCI 诊断。数据按 7:2:1 的比例划分为训练集、验证集和测试集,用于模型微调和评估,并使用来自 MIMIC III 的额外转移性癌症数据集进一步评估推理一致性。GPT-4 展示了卓越的解读能力,特别是在应对复杂提示时,但也表现出显著的响应 - 推理不一致性。相比之下,Falcon 和 LLaMA 2 等开源模型虽然取得了高准确率,但缺乏解释性推理,这突显了进一步优化性能和可解释性的必要性。本研究强调了提示工程的重要性,以及进一步探索 GPT-4 中观察到的意外推理 - 响应不一致性的需求。结果强调了将 LLM 纳入医疗诊断的前景,但这取决于方法学的进步,以确保 AI 生成输出的准确性和临床连贯性,从而提高 LLM 在医疗决策中的可信度。

关键词

引用

@article{arxiv.2312.14184,
  title  = {Large Language Models in Medical Term Classification and Unexpected Misalignment Between Response and Reasoning},
  author = {Xiaodan Zhang and Sandeep Vemulapalli and Nabasmita Talukdar and Sumyeong Ahn and Jiankun Wang and Han Meng and Sardar Mehtab Bin Murtaza and Aakash Ajay Dave and Dmitry Leshchiner and Dimitri F. Joseph and Martin Witteveen-Lane and Dave Chesla and Jiayu Zhou and Bin Chen},
  journal= {arXiv preprint arXiv:2312.14184},
  year   = {2023}
}