应对医疗语言模型中的认知偏差
计算与语言
2024-02-22 v3 人机交互
摘要
人们对将大型语言模型(LLM)应用于医疗领域的兴趣日益浓厚,部分原因是它们在医学考试问题上的出色表现。虽然前景广阔,但考试问题并不能反映真实医患互动的复杂性。在现实中,医生的决策受到许多复杂因素的影响,例如患者的依从性、个人经验、伦理信念和认知偏差。为了增进对此的理解,我们的假设提出,当 LLM 面对包含认知偏差的临床问题时,与没有此类偏差的相同问题相比,它们给出的回答准确率会显著降低。在本研究中,我们开发了 BiasMedQA,这是一个用于评估应用于医疗任务的 LLM 中认知偏差的基准。我们使用 BiasMedQA 评估了六个 LLM,即 GPT-4、Mixtral-8x70B、GPT-3.5、PaLM-2、Llama 2 70B-chat 以及医疗专用的 PMC Llama 13B。我们在来自美国医师执照考试(USMLE)第 1、2 和 3 阶段的 1,273 个问题上测试了这些模型,并对问题进行了修改以复制常见的临床相关认知偏差。我们的分析揭示了这些偏差对 LLM 的不同影响,其中 GPT-4 因其抗偏差能力而脱颖而出,相比之下,Llama 2 70B-chat 和 PMC Llama 13B 受认知偏差的影响过大。我们的研究结果突出了在医疗 LLM 开发中缓解偏差的关键必要性,指向在医疗保健中更安全、更可靠的应用。
引用
@article{arxiv.2402.08113,
title = {Addressing cognitive bias in medical language models},
author = {Samuel Schmidgall and Carl Harris and Ime Essien and Daniel Olshvang and Tawsifur Rahman and Ji Woong Kim and Rojin Ziaei and Jason Eshraghian and Peter Abadir and Rama Chellappa},
journal= {arXiv preprint arXiv:2402.08113},
year = {2024}
}