大语言模型能否纠正医生?探究医疗领域中的有效交互方法
计算与语言
2024-05-07 v2 人工智能
摘要
我们探索了大语言模型(LLMs)在医疗决策任务中辅助甚至纠正医生的潜力。我们评估了多个LLM,包括Meditron、Llama2和Mistral,以分析这些模型在不同场景下与医生有效交互的能力。我们考虑了来自PubMedQA的问题以及多项任务,范围从二元(是/否)回答到长答案生成,其中模型的答案是在与医生交互后产生的。我们的研究结果表明,提示设计显著影响LLM的下游准确性,并且LLM可以为医生提供有价值的反馈,挑战错误诊断并有助于更准确的决策。例如,当医生准确率为38%时,Mistral可以产生正确答案,根据所使用的提示,准确率可提升至74%,而Llama2和Meditron模型对提示选择表现出更高的敏感性。我们的分析还揭示了确保LLM生成的建议相关且有用的挑战,强调了在该领域进一步研究的必要性。
引用
@article{arxiv.2403.20288,
title = {Can LLMs Correct Physicians, Yet? Investigating Effective Interaction Methods in the Medical Domain},
author = {Burcu Sayin and Pasquale Minervini and Jacopo Staiano and Andrea Passerini},
journal= {arXiv preprint arXiv:2403.20288},
year = {2024}
}
备注
Accepted for oral presentation at NAACL 2024, The 6th Clinical Natural Language Processing Workshop