AI辅助自诊断中的医疗错误信息:用于分析大语言模型的方法(EvalPrompt)的开发
计算机与社会
2025-04-01 v2
摘要
大语言模型(LLMs)在医疗保健中的快速集成正在引发全球讨论,关乎其革新医疗保健质量与可及性的潜力。在改善医疗保健质量与可及性仍是世界各国关键关切之际,这些模型通过医学考试的能力常被引作将其用于医学训练与诊断的理由。然而,它们作为自诊断工具被不可避免地使用所产生的影响,以及它们在传播医疗错误信息中的作用尚未得到评估。本研究旨在从个体自诊断的视角评估 LLMs(尤其是 ChatGPT)的有效性,以更好地理解模型的清晰性、正确性与鲁棒性。我们提出了大语言模型提示评估的综合测试方法(EvalPrompt)。该评估方法使用多选题医学执照考试问题来评估 LLM 的回答。我们使用开放式问题来模拟真实世界的自诊断用例,并执行句子丢弃以模拟带有缺失信息的真实自诊断。人类评估者随后对 ChatGPT 在两项实验中返回的回答就清晰性、正确性与鲁棒性进行评估。结果凸显了 LLMs 有限的能力,因为其回答常常不清晰且不准确。因此,应谨慎对待 LLMs 给出的医疗建议。然而,有证据表明 LLMs 正在稳步改进,并可能在未来医疗保健系统中发挥作用。为解决医疗错误信息问题,迫切需要一个综合自诊断数据集的开发。该数据集可通过涵盖更广泛医学领域中信息极少、更贴近真实的提示风格,提升 LLMs 在医疗应用中的可靠性。
引用
@article{arxiv.2307.04910,
title = {Medical Misinformation in AI-Assisted Self-Diagnosis: Development of a Method (EvalPrompt) for Analyzing Large Language Models},
author = {Troy Zada and Natalie Tam and Francois Barnard and Marlize Van Sittert and Venkat Bhat and Sirisha Rambhatla},
journal= {arXiv preprint arXiv:2307.04910},
year = {2025}
}
备注
11 pages, 3 figures, Journal of Medical Internet Research: Formative Research