中文

XBench:胸部 X 光片视觉-语言解释综合基准

计算机视觉与模式识别 2025-10-23 v1 人工智能

摘要

视觉-语言模型 (VLM) 近期在医学图像理解中展现出惊人的零样性能,但其依据能力——即文本概念与视觉证据的对齐程度——仍未得到充分探索。在医学领域,可靠的依据能力对于解释性和临床采用至关重要。本文我们提出了首个系统性基准,用于评估胸部 X 光片中跨模态解释性。我们在七种基于 CLIP 风格的 VLM 变体上生成视觉解释,利用交叉注意力和基于相似性的位置映射量化评估其与放射科医生标注区域在多种病灶上的对齐情况。我们的分析揭示了:(1) 虽然所有 VLM 变体在大且明确定义的病灶上表现出合理的位置化,但在小或弥散性病灶上的性能显著下降;(2) 针对胸部 X 光片特定数据集预训练的模型在对齐方面优于在一般领域数据上训练的模型。(3) 模型的整体识别能力和依据能力强强相关。这些发现凸显了尽管当前 VLM 在识别能力方面表现突出,但在临床可靠的依据能力方面仍有不足,突显了在医疗实践中部署前需针对可解释性开发针对性基准测试的必要性。XBench 代码可在 https://github.com/Roypic/Benchmarkingattention 获取。

关键词

引用

@article{arxiv.2510.19599,
  title  = {XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography},
  author = {Haozhe Luo and Shelley Zixin Shu and Ziyu Zhou and Sebastian Otalora and Mauricio Reyes},
  journal= {arXiv preprint arXiv:2510.19599},
  year   = {2025}
}