医学影像中的细粒度图文对齐实现可解释的循环图像-报告生成
计算机视觉与模式识别
2024-08-20 v5 人工智能
计算与语言
摘要
为解决这些问题,我们提出了一种新颖的自适应图像块-词语匹配(AdaMatch)模型,用于关联胸部X光(CXR)图像区域与医学报告中的词语,并将其应用于CXR报告生成,为生成过程提供可解释性。AdaMatch利用自适应图像块与词语之间的细粒度关系,为特定图像区域提供对应词语的解释。为捕获不同大小和位置的异常区域,我们引入了自适应图像块提取(AdaPatch)模块,以自适应地获取这些区域的图像块。为了为CXR报告生成任务提供显式的可解释性,我们提出了一种基于AdaMatch的双向大语言模型,用于循环CXR报告生成(AdaMatch-Cyclic)。它利用AdaMatch获取CXR图像的关键词和医学报告的“关键图像块”作为提示,以指导CXR报告生成。在两个公开CXR数据集上的大量实验证明了我们方法的有效性及其相较于现有方法的优越性能。
引用
@article{arxiv.2312.08078,
title = {Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation},
author = {Wenting Chen and Linlin Shen and Jingyang Lin and Jiebo Luo and Xiang Li and Yixuan Yuan},
journal= {arXiv preprint arXiv:2312.08078},
year = {2024}
}
备注
Accepted by ACL 2024