CLIP-TNseg:用于超声图像甲状腺结节分割的多模态混合框架
计算机视觉与模式识别
2024-12-10 v1
摘要
超声图像中的甲状腺结节分割对于准确的诊断和治疗计划至关重要。然而,现有方法在分割准确性、可解释性和泛化能力方面面临挑战,这阻碍了其性能。本文提出了一种名为CLIP-TNseg的框架来解决这些问题,该框架将多模态大模型与神经网络架构相结合。CLIP-TNseg由两个主要分支组成:粗粒度分支,从冻结的CLIP模型中提取高层语义特征;以及细粒度分支,使用U-Net风格的残差块捕获细粒度特征。这些特征被融合并由预测头处理,以生成精确的分割图。CLIP-TNseg利用粗粒度分支通过文本和高层视觉特征增强语义理解,而细粒度分支则细化空间细节,从而实现鲁棒的分割。在公开数据集和我们收集的数据集上进行的大量实验证明了其优越的性能。我们的代码和原始数据集可在 https://github.com/jayxjsun/CLIP-TNseg 获取。
引用
@article{arxiv.2412.05530,
title = {CLIP-TNseg: A Multi-Modal Hybrid Framework for Thyroid Nodule Segmentation in Ultrasound Images},
author = {Xinjie Sun and Boxiong Wei and Yalong Jiang and Liquan Mao and Qi Zhao},
journal= {arXiv preprint arXiv:2412.05530},
year = {2024}
}
备注
4 pages, 2 figures, submitted to IEEE Signal Processing Letters