中文

生物医学图像与文本中多模态深度学习的范围综述

计算机视觉与模式识别 2023-10-20 v3 计算与语言

摘要

未来的计算机辅助诊断与预后系统应能够同时处理多模态数据。涉及图像与文本等多源数据融合的多模态深度学习(MDL)有潜力革新生物医学数据的分析与解读。然而,它近期才引起研究者关注。为此,亟需对该主题进行系统综述,识别当前工作的局限并探索未来方向。本范围综述旨在全面概述该领域现状,识别关键概念、研究类型与研究空白,重点关注生物医学图像与文本的联合学习,主要因为这两类是MDL研究中最常见的可用数据类型。本研究回顾了MDL在五项任务中的当前应用:(1)报告生成,(2)视觉问答,(3)跨模态检索,(4)计算机辅助诊断,以及(5)语义分割。我们的结果凸显了MDL的多样应用与潜力,并提出了该领域未来研究方向。希望本综述能促进自然语言处理(NLP)与医学影像界的协作,并支撑下一代决策与计算机辅助诊断系统开发。

关键词

引用

@article{arxiv.2307.07362,
  title  = {A scoping review on multimodal deep learning in biomedical images and texts},
  author = {Zhaoyi Sun and Mingquan Lin and Qingqing Zhu and Qianqian Xie and Fei Wang and Zhiyong Lu and Yifan Peng},
  journal= {arXiv preprint arXiv:2307.07362},
  year   = {2023}
}

备注

This paper has been accepted by the Journal of Biomedical Informatics