中文

医学视觉-语言应用及其技术综述

计算机视觉与模式识别 2024-11-20 v1

摘要

医学视觉-语言模型(MVLMs)因其能够为解释复杂医学数据提供自然语言界面而引起了广泛兴趣。它们的应用多样,有潜力提高个体患者的诊断准确性和决策能力,同时通过更高效地分析大型数据集,有助于加强公共卫生监测、疾病监测和政策制定。MVLMs将自然语言处理与医学图像相结合,从而能够更全面、更情境化地理解医学图像及其对应的文本信息。与在多样化、非专业数据集上训练的通用视觉-语言模型不同,MVLMs专为医学领域构建,自动从医学图像和文本报告中提取和解释关键信息,以支持临床决策。MVLMs的流行临床应用包括自动医学报告生成、医学视觉问答、医学多模态分割、诊断与预后以及医学图像-文本检索。在此,我们全面概述了MVLMs及其所应用的各种医学任务。我们详细分析了各种视觉-语言模型架构,重点关注它们在跨模态整合/利用医学视觉和文本特征方面的不同策略。我们还检查了这些任务所使用的数据集,并基于标准化评估指标比较了不同模型的性能。此外,我们强调了潜在挑战,并总结了未来的研究趋势和方向。论文和代码的完整集合可在以下网址获取:https://github.com/YtongXie/Medical-Vision-and-Language-Tasks-and-Methodologies-A-Survey。

关键词

引用

@article{arxiv.2411.12195,
  title  = {A Survey of Medical Vision-and-Language Applications and Their Techniques},
  author = {Qi Chen and Ruoshan Zhao and Sinuo Wang and Vu Minh Hieu Phan and Anton van den Hengel and Johan Verjans and Zhibin Liao and Minh-Son To and Yong Xia and Jian Chen and Yutong Xie and Qi Wu},
  journal= {arXiv preprint arXiv:2411.12195},
  year   = {2024}
}