利用文本引导扩散模型增强标签高效的医学图像分割
图像与视频处理
2024-07-09 v1 计算机视觉与模式识别
摘要
除了在医学图像生成中提供最先进的性能外,去噪扩散概率模型(DPM)还可以作为表示学习器来捕获语义信息,并潜在地用作下游任务(例如分割)的图像表示。然而,这些潜在语义表示严重依赖于劳动密集型的像素级标注作为监督,限制了DPM在医学图像分割中的可用性。为了解决这一限制,我们提出了一种增强型扩散分割模型,称为TextDiff,该模型通过廉价的医学文本标注来改进语义表示,从而为扩散模型显式地建立语义表示和语言对应关系。具体来说,TextDiff从在大规模自然图像上预训练的扩散模型中提取反向扩散过程马尔可夫步的中间激活,并通过将它们与互补且易于获得的诊断文本信息相结合来学习额外的专家知识。TextDiff冻结了双分支多模态结构,并通过仅训练交叉注意力机制和像素分类器来挖掘扩散模型中语义特征与诊断描述的潜在对齐,从而使得用廉价文本增强语义表示成为可能。在公开的QaTa-COVID19和MoNuSeg数据集上进行的大量实验表明,我们的TextDiff在仅使用少量训练样本的情况下显著优于最先进的多模态分割方法。
引用
@article{arxiv.2407.05323,
title = {Enhancing Label-efficient Medical Image Segmentation with Text-guided Diffusion Models},
author = {Chun-Mei Feng},
journal= {arXiv preprint arXiv:2407.05323},
year = {2024}
}
备注
MICCAI 2024, Early Accept