中文

少即是多?针对多模态放射学摘要的高重要性区域选择性视觉注意力

计算机视觉与模式识别 2026-04-01 v1 计算与语言

摘要

自动放射学报告摘要旨在将冗长的发现提炼为简洁的临床印象,但现有的多模态模型往往难以应对视觉噪声,并且在从FINDINGS到IMPRESSION的转换中未能显著超越强大的纯文本基线。我们挑战两个普遍假设:(1)更多的视觉输入总是更好,(2)当发现已经包含丰富的图像衍生细节时,多模态模型增加的价值有限。通过在MIMIC-CXR基准上的受控消融实验,我们证明聚焦于病理相关的视觉补丁而非完整图像能显著提升性能。我们引入ViTAS(Visual-Text Attention Summarizer),一个多阶段流水线,结合集成引导的MedSAM2肺部分割、用于多视图融合的双向交叉注意力、Shapley引导的自适应补丁聚类以及馈入ViT的分层视觉token化。ViTAS取得了SOTA结果,BLEU-4为29.25%,ROUGE-L为69.83%,定性分析中事实对齐性更好,且获得了最高专家评分的人工评估分数。我们的发现表明,更少但更相关的视觉输入不仅足够,而且优于多模态放射学摘要。

关键词

引用

@article{arxiv.2603.29901,
  title  = {Less Is More? Selective Visual Attention to High-Importance Regions for Multimodal Radiology Summarization},
  author = {Mst. Fahmida Sultana Naznin and Adnan Ibney Faruq and Mushfiqur Rahman and Niloy Kumar Mondal and Md. Mehedi Hasan Shawon and Md Rakibul Hasan},
  journal= {arXiv preprint arXiv:2603.29901},
  year   = {2026}
}