MedFuzz:探索大型语言模型在医学问答中的鲁棒性
计算与语言
2024-09-04 v2 机器学习
摘要
大型语言模型(LLM)在医学问答基准测试上取得了令人瞩目的成绩。然而,高水平的基准准确率并不意味着该成绩能在现实临床环境中推广。医学问答基准测试依赖于量化 LLM 性能的假设,而这些假设可能不适用于诊所的开放世界。然而,LLM 学习的是广泛的知识,这有助于 LLM 在不受celebrated基准中不现实假设限制的情况下推广到实际场景。我们寻求量化 LLM 医学问答基准测试表现在基准假设被破坏时的推广程度。具体而言,我们提出了一种对抗方法,称为 MedFuzz(医学模糊化)。MedFuzz 旨在以旨至干扰 LLM 的方式修改基准问题。我们以针对 MedQA 基准中关于患者特征的强假设为例演示了该方法。成功的“攻击”会以不太可能误导医学专家的方式修改基准题目,但会“骗” LLM 将正确答案改为错误答案。此外,我们提出了一种置换检验技术,可确保成功的攻击在统计上具有显著性。我们展示了如何使用“MedFuzzed”基准表现,以及如何使用单个成功攻击。这些方法有望为了解 LLM 在更真实环境中运行的鲁棒性提供所需的洞见。
引用
@article{arxiv.2406.06573,
title = {MedFuzz: Exploring the Robustness of Large Language Models in Medical Question Answering},
author = {Robert Osazuwa Ness and Katie Matton and Hayden Helm and Sheng Zhang and Junaid Bajwa and Carey E. Priebe and Eric Horvitz},
journal= {arXiv preprint arXiv:2406.06573},
year = {2024}
}
备注
9 pages, 3 figures, 2 algorithms, appendix