Chest X 射线错误数据集与视觉语言模型基准测试——面向报告纠错的 CorBenchX
人工智能
2025-05-20 v1
摘要
AI 驱动的模型在检测放射报告中的错误方面显示出巨大的潜力,但该领域缺乏统一的基准进行严格的错误检测与纠正评估。为填补这一空白,我们引入 CorBenchX——一个针对胸部 X 射线报告的全面套件,用于自动化错误检测与纠正,旨在推动临床实践中的 AI 辅助质量控制。我们首先通过引导 DeepSeek-R1 合成了包含 26,326 条胸部 X 射线错误报告的大规模数据集,其中每条被损坏的报告均配有原始文本、错误类型及人类可读描述。基于该数据集,我们对开源和闭源视觉语言模型(如 InternVL、Qwen-VL、GPT-4o、o4-mini 和 Claude-3.7)进行了在零样本提示下的错误检测与纠正基准测试。在这些模型中,o4-mini 实现了最佳性能,检测准确率达 50.6%,纠正得分为 BLEU 0.853、ROUGE 0.924、BERTScore 0.981、SembScore 0.865 和 CheXbertF1 0.954,但仍低于临床水平的准确率,这凸显了精确报告纠正的挑战。为推动技术发展,我们提出了一种多步骤强化学习 (MSRL) 框架,通过结合格式合规性、错误类型准确性和 BLEU 相似性的多目标奖励进行优化。我们将 MSRL 应用于 QwenVL2.5-7B(我们基准测试中表现最好的开源模型),实现了单错误检测精度提升 38.3%,单错误纠正提升 5.2%。
引用
@article{arxiv.2505.12057,
title = {CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction},
author = {Jing Zou and Qingqiu Li and Chenyu Lian and Lihao Liu and Xiaohan Yan and Shujun Wang and Jing Qin},
journal= {arXiv preprint arXiv:2505.12057},
year = {2025}
}
备注
12 pages, 5figures