基于现代BERT的文本条件扩散模型用于医学图像分割
计算机视觉与模式识别
2025-12-02 v1 机器学习
摘要
近期来,去噪扩散概率模型(DPM)在医学图像生成与去噪方面显示出色,亦可作为下游分割任务的表征学习器。然而,分割性能受限于需要密集的像素级标签,这些标签昂贵、耗时且需要专业知识。我们提出FastTextDiff,一种标签高效的扩散分割模型,集成医学文本注释以增强语义表征。该方法采用ModernBERT——一种能够处理长时间临床笔记的变换器——将文本注释与医学图像中的语义内容紧密关联。模型在MIMIC-III和MIMIC-IV数据集上训练,ModernBERT编码的临床知识指导了视觉特征与文本特征之间的跨模态注意力。本研究验证了ModernBERT作为扩散分割管道中快速、可扩展的Clinical BioBERT替代方案,凸显了多模态技术在医学图像分析中的潜力。通过取代Clinical BioBERT使用ModernBERT,FastTextDiff受益于FlashAttention 2、交替注意力机制以及2万亿token语料库的加持,在分割准确率和训练效率方面均优于传统基于扩散的方法。
引用
@article{arxiv.2512.00084,
title = {A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation},
author = {Venkata Siddharth Dhara and Pawan Kumar},
journal= {arXiv preprint arXiv:2512.00084},
year = {2025}
}
备注
15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)