中文

大语言模型在医疗对话中错误的自动复现

计算与语言 2026-04-08 v2 人工智能 机器学习

摘要

大语言模型(LLM)在临床环境中正越来越多地通过多维度评估标准进行评价,这些标准量化了推理质量、安全性和以患者为中心的程度。然而,在其他LLM模型中复现特定错误并非易事,通常需要人工操作。我们引入了MedMistake,这是一个自动化流程,用于提取LLM在医患对话中犯下的错误,并将其转换为单轮问答对的基准。我们的流程包括:(1) 在LLM患者和LLM医生之间创建复杂的对话数据;(2) 由一个包含2名LLM评判员的委员会在多个维度上进行评估;(3) 从这些错误中创建简化的单轮问答场景。我们发布了MedMistake-All数据集,其中包含3390个单轮问答对,根据两名LLM评判员的判断,GPT-5和Gemini 2.5 Pro目前无法正确回答这些问题。我们请医学专家验证了其中的一个子集,包含211/3390个问题(MedMistake-Bench),并用其对12个前沿LLM进行了最终评估:Claude Opus 4.5、Claude Sonnet 4.5、DeepSeek-Chat、Gemini 2.5 Pro、Gemini 3 Pro、GPT-4o、GPT-5、GPT-5.1、GPT-5.2、Grok 4、Grok 4.1、Mistral Large。我们发现GPT模型、Claude和Grok在MedMistake-Bench上取得了最佳性能。我们在https://huggingface.co/datasets/TheLumos/MedicalMistakeBenchmark上发布了经医生验证的基准(MedMistake-Bench)以及完整数据集(MedMistake-All)。

关键词

引用

@article{arxiv.2512.20983,
  title  = {Automatic Replication of LLM Mistakes in Medical Conversations},
  author = {Oleksii Proniakin and Diego Fajardo and Ruslan Nazarenko and Razvan Marinescu},
  journal= {arXiv preprint arXiv:2512.20983},
  year   = {2026}
}

备注

48 pages, 3 figures, 4 tables