区域注意力增强的 Swin Transformer 用于临床相关医学图像描述
计算机视觉与模式识别
2025-11-14 v1 计算与语言
摘要
自动化医学图像描述将复杂的放射学图像转化为诊断性叙述,可以支持报告工作流程。我们提出了一种 Swin-BART 编码器-解码器系统,带有一个轻量级的区域注意力模块,该模块在交叉注意力之前放大诊断上显著的区域。在 ROCO 上训练和评估,我们的模型在保持紧凑和可解释性的同时,实现了最先进的语义保真度。我们报告了三个随机种子上的均值标准差结果,并包含了 置信区间。与基线相比,我们的方法改进了 ROUGE(提出的 0.603,ResNet-CNN 0.356,BLIP2-OPT 0.255)和 BERTScore(提出的 0.807,BLIP2-OPT 0.645,ResNet-CNN 0.623),并具有有竞争力的 BLEU、CIDEr 和 METEOR 分数。我们进一步提供了消融实验(区域注意力开/关和令牌数量扫描)、按模态分析(CT/MRI/X 光)、配对显著性检验以及可视化驱动每个描述区域的热力图。解码使用束搜索(束大小 )、长度惩罚 、 和最大长度 。所提出的设计产生了准确、临床措辞的描述和透明的区域归因,支持在人工参与下的安全研究用途。
引用
@article{arxiv.2511.09893,
title = {Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning},
author = {Zubia Naz and Farhan Asghar and Muhammad Ishfaq Hussain and Yahya Hadadi and Muhammad Aasim Rafique and Wookjin Choi and Moongu Jeon},
journal= {arXiv preprint arXiv:2511.09893},
year = {2025}
}