中文

C^2M-DoT:基于域迁移网络的跨模态一致多视图医学报告生成

计算机视觉与模式识别 2023-10-10 v1

摘要

在临床场景中,通常同时生成具有不同视图的多种医学图像,且这些图像具有高度语义一致性。然而,现有大多数医学报告生成方法仅考虑单视图数据。医学图像丰富的多视图互信息有助于生成更准确的报告,但多视图模型在推理阶段对多视图数据的依赖严重限制了其在临床实践中的应用。此外,基于数值的词级优化忽略了报告与医学图像的语义,生成的报告往往难以取得良好表现。为此,我们提出一种基于域迁移网络的跨模态一致多视图医学报告生成方法(C^2M-DoT)。具体而言:(i)采用基于语义的多视图对比学习医学报告生成框架,利用跨视图信息学习病灶的语义表示;(ii)进一步提出域迁移网络,确保多视图报告生成模型在单视图输入下仍能取得良好推理性能;(iii)同时,利用跨模态一致性损失进行优化,促进生成与医学图像语义一致的文本报告。在两个公开基准数据集上的大量实验表明,C^2M-DoT在所有指标上均大幅优于最先进的基线。消融研究也证实了C^2M-DoT中各组件的有效性与必要性。

关键词

引用

@article{arxiv.2310.05355,
  title  = {C^2M-DoT: Cross-modal consistent multi-view medical report generation with domain transfer network},
  author = {Ruizhi Wang and Xiangtao Wang and Jie Zhou and Thomas Lukasiewicz and Zhenghua Xu},
  journal= {arXiv preprint arXiv:2310.05355},
  year   = {2023}
}