中文

医学大语言模型容易受到干扰

计算与语言 2025-04-03 v1 人工智能 人机交互

摘要

大语言模型(LLMs)有望在医学领域发挥变革性作用,但实际临床场景包含可能阻碍绩效的额外信息。类似语音助理等技术,如自动从实时患者接触生成草稿笔记的技术, can引入额外噪声,使评估 LLMs 过滤相关数据能力变得至关重要。为此,我们开发了 MedDistractQA,一个使用嵌入模拟真实干扰信息的 USMLE 风格问题基准测试。我们的发现表明,干扰性陈述(在非临床语境下用于临床含义的多义词或与无关健康状况的引用)可使 LLM 准确率下降最高可达 17.9%。常用的方法如检索增强生成(RAG)和医学微调未能改变这一效果,某些情况下甚至引入自身的干扰因素并进一步降低绩效。我们的发现表明,LLMs 本身缺乏区分相关与不相关临床信息的逻辑机制,给实际应用带来了挑战。MedDistractQA 和我们的研究结果凸显了需要 robust 的缓解策略来增强 LLMs 对额外信息的韧性。

关键词

引用

@article{arxiv.2504.01201,
  title  = {Medical large language models are easily distracted},
  author = {Krithik Vishwanath and Anton Alyakin and Daniel Alexander Alber and Jin Vivian Lee and Douglas Kondziolka and Eric Karl Oermann},
  journal= {arXiv preprint arXiv:2504.01201},
  year   = {2025}
}

备注

20 pages, 2 main figures, 6 extended figures