释放视觉语言预训练在3D零样图病灶分割中的潜能:通过掩码-属性对齐
计算机视觉与模式识别
2025-03-04 v2 人工智能
摘要
最近的医学视觉语言预训练模型的进展推动了在零样图疾病识别方面的显著进展。然而,将图像级知识传递到像素级任务(如3D CT扫描中的病灶分割)仍是一个关键挑战。由于病理视觉特征的复杂性和可变性,现有方法难以将训练期未遇到的细粒度病灶特征与与疾病相关的文本表示进行对齐。本文中,我们提出了 Malenia,一种 novel 多尺度病灶级掩码-属性对齐框架,专为3D零样图病灶分割设计。Malenia 改进了掩码表示与其关联元素属性之间的兼容性,显式地将不可见病灶的视觉特征与来自先前seen病灶所学习的可扩展知识相链接。此外,我们设计了跨模态知识注入模块,以增强视觉和文本特征,有效指导分段结果的生成。全面的实验在三个数据集和 12 个病灶类别中验证了 Malenia 的卓越性能。
引用
@article{arxiv.2410.15744,
title = {Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment},
author = {Yankai Jiang and Wenhui Lei and Xiaofan Zhang and Shaoting Zhang},
journal= {arXiv preprint arXiv:2410.15744},
year = {2025}
}
备注
Accepted as ICLR 2025 conference paper