提示语言影响大型语言模型的诊断推理与准确性
计算与语言
2026-05-20 v1
摘要
大型语言模型(LLMs)正日益被用于临床决策支持,但大多数评估在英语中进行,留下了其在其他语言中的可靠性存疑之问。本文通过比较英语和法语表现,对五种LLMs(o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct和BioMistral-7B)的诊断推理和最终诊断准确性进行评估。共评估180个覆盖16个医学专科的临床情景,由两位医生使用18点量规对其进行评估,既评估诊断准确性,又评估推理质量。其中四个模型在英语中表现更好(平均差值为0.37-0.91,调整后p<0.05),差距跨越推理的多个方面,包括差异诊断、逻辑结构和内部有效性。o3是唯一一个在整体语言效应上无显著差异的模型。这一发现表明,提示语言仍是LLM临床性能的关键决定因素,对于全球范围内的语言-文化公平部署具有深远意义。
引用
@article{arxiv.2605.19173,
title = {Prompting language influences diagnostic reasoning and accuracy of large language models},
author = {Adrien Bazoge and Josselin Corvellec and Sofiane Djillali Sid-Ahmed and Pierre-Antoine Gourraud},
journal= {arXiv preprint arXiv:2605.19173},
year = {2026}
}