中文

结合多个大语言模型的见解可提高诊断准确性

人工智能 2024-10-21 v1

摘要

背景:诸如 OpenAI 的 GPT-4 或 Google 的 PaLM 2 等大语言模型(LLM)被提议作为可行的诊断支持工具,甚至被称为“路边会诊”的替代品。然而,即使是专门针对医学主题训练的 LLM,也可能缺乏足够的诊断准确性以用于实际应用。方法:利用集体智能方法和一个包含 200 个真实病例临床小插图的数据集,我们评估并比较了通过询问单个商业 LLM(OpenAI GPT-4、Google PaLM 2、Cohere Command、Meta Llama 2)获得的鉴别诊断的准确性,与通过聚合来自相同 LLM 组合的响应而综合得出的鉴别诊断的准确性。结果:我们发现,聚合来自多个不同 LLM 的响应可得到更准确的鉴别诊断(3 个 LLM 的平均准确率:75.3% ± 1.6 个百分点),相比之下,单个 LLM 产生的鉴别诊断准确率较低(单个 LLM 的平均准确率:59.0% ± 6.1 个百分点)。讨论:使用集体智能方法综合不同 LLM 的响应来合成鉴别诊断,实现了推进 LLM 作为诊断支持工具被接受所需的两个必要步骤:(1)展示高诊断准确性,以及(2)消除对单一商业供应商的依赖。

关键词

引用

@article{arxiv.2402.08806,
  title  = {Combining Insights From Multiple Large Language Models Improves Diagnostic Accuracy},
  author = {Gioele Barabucci and Victor Shia and Eugene Chu and Benjamin Harack and Nathan Fu},
  journal= {arXiv preprint arXiv:2402.08806},
  year   = {2024}
}

备注

5 pages, 2 figures, 1 table