RadZero:基于相似性的跨注意力用于零样本胸部X光多任务可解释视觉语言对齐
计算机视觉与模式识别
2025-11-07 v3 计算与语言
机器学习
摘要
最近的多模态模型显著改进了放射学中的视觉语言(VL)对齐。然而,现有方法在利用复杂放射科报告进行学习方面效果有限,同时通过注意力概率可视化提供的解释性有限。为此,我们引入了RadZero,一个用于胸部X光的VL对齐框架,具备零样本多任务能力。我们方法的关键组件是VL-CABS(Vision-Language Cross-Attention Based on Similarity),它将文本嵌入与局部图像特征对齐,以实现可解释的、精细的VL推理。RadZero利用大型语言模型从放射科报告中提取简洁的语义句子,并采用多正面对比训练有效地捕获图像与多个相关文本描述之间的关系。它使用预训练的视觉编码器并添加可训练的Transformer层,实现高效的高分辨率图像处理。通过计算文本嵌入与局部图像补丁特征之间的相似性,VL-CABS实现了基于相似性概率的零样本推断,用于分类,以及基于相似性的像素级VL映射,用于 grounding 和分割。在公共胸部X光基准测试上的实验结果表明,RadZero 在零样本分类、grounding 和分割方面均优于最先进的方法。此外,VL相似性图分析突显了VL-CABS 在VL对齐中提高可解释性的潜力。此外,定性评估表明RadZero在开放词汇语义分割方面具有能力,进一步验证了其在医学影像中的有效性。代码可在https://github.com/deepnoid-ai/RadZero上获取。
引用
@article{arxiv.2504.07416,
title = {RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability},
author = {Jonggwon Park and Byungmu Yoon and Soobum Kim and Kyoyun Choi},
journal= {arXiv preprint arXiv:2504.07416},
year = {2025}
}
备注
NeurIPS 2025