中文

密集视觉引导网络用于放射学报告生成

计算机视觉与模式识别 2024-02-07 v1

摘要

自动放射学报告生成因其在医疗保健行业的巨大应用潜力而蓬勃发展。然而,现有的计算机视觉和自然语言处理方法在解决这一问题时存在两个方面的局限性。首先,在提取图像特征时,大多数方法忽略了视觉中的多视图推理,并建模了医学图像的单视图结构,例如空间视图或通道视图。然而,临床医生在日常临床诊断中依赖多视图成像信息进行综合判断。其次,在生成报告时,它们忽略了多模态信息的上下文推理,并专注于利用基于检索的方法进行纯文本优化。我们旨在通过提出一个更好地模拟临床医生视角并生成更准确报告的模型来解决这两个问题。鉴于上述特征提取中的局限性,我们在医学图像编码器中提出了一个全局密集注意力(GIA)模块来模拟和整合多视图视觉感知。GIA旨在学习三种视觉感知:深度视图、空间视图和像素视图。另一方面,为了解决报告生成中的上述问题,我们探索如何引入多模态信号以生成精确匹配的报告,即如何在下一个词预测中整合先前预测的词与区域感知的视觉内容。具体来说,我们设计了一个视觉知识引导的解码器(VKGD),它可以自适应地考虑模型需要依赖视觉信息和先前预测文本的程度来辅助下一个词预测。因此,我们最终的密集视觉引导网络(IVGN)框架包括一个GIA引导的视觉编码器和VKGD。在两个常用数据集IU X-Ray和MIMIC-CXR上的实验表明,我们的方法相比其他最先进的方法具有优越的能力。

关键词

引用

@article{arxiv.2402.03754,
  title  = {Intensive Vision-guided Network for Radiology Report Generation},
  author = {Fudan Zheng and Mengfei Li and Ying Wang and Weijiang Yu and Ruixuan Wang and Zhiguang Chen and Nong Xiao and Yutong Lu},
  journal= {arXiv preprint arXiv:2402.03754},
  year   = {2024}
}

备注

Accepted by Physics in Medicine & Biology