CAMANet:用于放射学报告生成的类激活图引导注意力网络
计算机视觉与模式识别
2024-03-05 v2
摘要
放射学报告生成(RRG)因其在缓解医疗资源短缺以及辅助放射科医生疾病决策过程中的巨大潜力而获得越来越多的研究关注。近期 RRG 的进展很大程度上由提升模型编码单模态特征表示的能力所驱动,而极少有研究显式探索图像区域与词之间的跨模态对齐。放射科医生通常先关注异常图像区域,再撰写相应文本描述,因此跨模态对齐对于学习一个能感知图像中异常的 RRG 模型至关重要。受此启发,我们提出类激活图引导注意力网络(CAMANet),其通过聚合类激活图来监督跨模态注意力学习,显式促进跨模态对齐,同时丰富判别信息。CAMANet 包含三个互补模块:视觉判别图生成模块用于生成各视觉词元的重要性/贡献;视觉判别图辅助编码器用于学习判别性表示并丰富判别信息;以及视觉–文本注意力一致性模块用于确保视觉与文本词元间的注意力一致性,以实现跨模态对齐。实验结果表明,CAMANet 在两个常用 RRG 基准上优于以往的 SOTA 方法。
引用
@article{arxiv.2211.01412,
title = {CAMANet: Class Activation Map Guided Attention Network for Radiology Report Generation},
author = {Jun Wang and Abhir Bhalerao and Terry Yin and Simon See and Yulan He},
journal= {arXiv preprint arXiv:2211.01412},
year = {2024}
}
备注
Accepted to IEEE Journal of Biomedical and Health Informatics (IJBHI). 13 pages, 8 figures