浅层鲁棒性,深层脆弱性:医学大语言模型的多轮评估
摘要
大语言模型(LLMs)正快速转向医学临床应用,但在真实场景下的多轮交互可靠性仍不为人所了解。现有的评估框架通常在理想条件下评估单轮问答,忽略了医学咨询中常见的冲突输入、误导性上下文以及权威影响等复杂性。我们引入 MedQA-Followup,一个系统性评估医学问答中多轮鲁棒性的框架。我们的 метод区分了浅层鲁棒性(抵抗误导性初始上下文)与深层鲁棒性(在多轮提问中保持准确性),同时引入间接-直接轴,将上下文性引导(间接)与明确建议(直接)进行区分。通过在 MedQA 数据集上进行受控干扰,我们评估了五种最先进的大语言模型,发现虽然模型在浅层扰动下表现良好,但在多轮场景中存在严重脆弱性,Claude Sonnet 4 的准确率从 91.2% 降至最低 13.5%。令人反意识的是,间接的、基于上下文的干扰往往比直接建议更具危害性,导致模型整体准确率下降更显著,这暴露了临床部署中的重要脆弱性。进一步的分析显示,不同模型之间存在差异,部分模型在重复干扰下表现进一步下降,而另一些模型则可能部分恢复甚至提升。这些发现表明,多轮鲁棒性是确保医学大语言模型安全可靠部署的关键但尚未被充分探索的维度。
引用
@article{arxiv.2510.12255,
title = {Shallow Robustness, Deep Vulnerabilities: Multi-Turn Evaluation of Medical LLMs},
author = {Blazej Manczak and Eric Lin and Francisco Eiras and James O' Neill and Vaikkunth Mugunthan},
journal= {arXiv preprint arXiv:2510.12255},
year = {2025}
}
备注
Dataset and code: https://huggingface.co/datasets/dynamoai-ml/MedQA-USMLE-4-MultiTurnRobust ; https://github.com/bmanczak/MedQA-MultiTurnRobustness Accepted as a poster at NeurIPS 2025 Workshop on GenAI for Health: Potential, Trust, and Policy Compliance