使用视觉-语言模型探索医学图像分割中的迁移学习
计算机视觉与模式识别
2024-06-21 v3 人工智能
计算与语言
机器学习
摘要
医学图像分割可量化目标结构的大小与形状,辅助疾病诊断、预后、手术规划与理解。基于近期自然图像-文本对基础视觉-语言模型(VLM)的进展,若干研究提出将其适配为视觉-语言分割模型(VLSM),从而可将语言文本作为分割模型的额外输入。在推理过程中通过文本引入辅助信息并结合人在环提示,开辟了独特机遇,如开放词汇分割,以及潜在地对分布外数据更具鲁棒性的分割模型。尽管从自然图像到医学图像的迁移学习已在仅图像分割模型中有所探索,视觉-语言在分割问题中的联合表示仍待充分研究。本研究首次系统性地探究了将 VLSM 迁移至 2D 医学图像,使用了精心整理的 个涵盖多种模态与洞见性语言提示的数据集及实验。我们的结果表明,尽管 VLSM 在有限医学图像数据集微调后相较仅图像模型具竞争力,但并非所有 VLSM 都利用了语言提示的额外信息,图像特征起主导作用。虽然 VLSM 在处理多模态合并数据集时表现出增强性能,并相较常规分割模型展现出对域偏移的潜在鲁棒性,我们的结果提示,需新方法以使 VLSM 能利用语言提示所提供的各类辅助信息。代码与数据集见 https://github.com/naamiinepal/medvlsm。
引用
@article{arxiv.2308.07706,
title = {Exploring Transfer Learning in Medical Image Segmentation using Vision-Language Models},
author = {Kanchan Poudel and Manish Dhakal and Prasiddha Bhandari and Rabin Adhikari and Safal Thapaliya and Bishesh Khanal},
journal= {arXiv preprint arXiv:2308.07706},
year = {2024}
}
备注
Medical Imaging with Deep Learning (MIDL) 2024 (Oral)