中文

跨模态原型驱动网络用于放射学报告生成

计算机视觉与模式识别 2022-07-12 v1 计算与语言

摘要

放射学报告生成(RRG)旨在以类人语言自动描述放射学图像,并有可能辅助放射科医生的工作,减轻手工报告的负担。以往方法常采用编码器-解码器架构并聚焦于单模态特征学习,而极少有研究探索跨模态特征交互。本文提出一种跨模态原型驱动网络(XPRONET)以促进跨模态模式学习,并利用其改进放射学报告生成任务。这通过三个精心设计、完全可微且互补的模块实现:一个共享跨模态原型矩阵用于记录跨模态原型;一个跨模态原型网络用于学习跨模态原型并将跨模态信息嵌入视觉与文本特征;以及一种改进的多标签对比损失以实现并增强多标签原型学习。XPRONET 在 IU-Xray 和 MIMIC-CXR 基准上取得显著提升,其在 IU-Xray 上的性能大幅超越近期最先进方法,在 MIMIC-CXR 上性能相当。

关键词

引用

@article{arxiv.2207.04818,
  title  = {Cross-modal Prototype Driven Network for Radiology Report Generation},
  author = {Jun Wang and Abhir Bhalerao and Yulan He},
  journal= {arXiv preprint arXiv:2207.04818},
  year   = {2022}
}

备注

Accepted to ECCV2022