中文

MedErr-CT: 用于识别和纠正 CT 报告中错误的视觉问答基准

计算机视觉与模式识别 2025-06-25 v1 人工智能

摘要

计算机断层扫描(CT)在临床诊断中起着至关重要的作用,但日益增长的 CT 检查需求引发了对诊断错误的担忧。虽然多模态大语言模型(MLLM)展现出对医学知识的有前景的理解能力,但它们产生不准确信息的倾向凸显了严格验证的必要性。然而,现有的医学视觉问答(VQA)基准主要关注简单的视觉识别任务,缺乏临床相关性,且未能评估专家级知识。我们引入了 MedErr-CT,这是一个新颖的基准,旨在通过 VQA 框架评估医学 MLLM 识别和纠正 CT 报告中错误的能力。该基准包含六种错误类别——四种以视觉为中心的错误(遗漏、插入、方向、大小)和两种词汇错误类型(单位、拼写错误)——并组织为三个任务层级:分类、检测和纠正。利用该基准,我们定量评估了最先进的 3D 医学 MLLM 的性能,揭示了它们在不同错误类型上的能力存在显著差异。我们的基准有助于开发更可靠且临床适用的 MLLM,最终帮助减少诊断错误并提高临床实践中的准确性。代码和数据集可在 https://github.com/babbu3682/MedErr-CT 获取。

关键词

引用

@article{arxiv.2506.19217,
  title  = {MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports},
  author = {Sunggu Kyung and Hyungbin Park and Jinyoung Seo and Jimin Sung and Jihyun Kim and Dongyeong Kim and Wooyoung Jo and Yoojin Nam and Sangah Park and Taehee Kwon and Sang Min Lee and Namkug Kim},
  journal= {arXiv preprint arXiv:2506.19217},
  year   = {2025}
}

备注

14 pages, 5 figures, submitted to CVPR 2025