XBusNet:基于多模态视觉-语言学习的文本引导乳腺超声分割
计算机视觉与模式识别
2025-09-10 v1 人工智能
摘要
背景:精确的乳腺超声 (BUS) 分割有助于可靠的测量、定量分析和下游分类,但对于边缘模糊、伴有斑点噪声的小尺寸或低对比度病灶,分割仍然困难。文本提示可以添加临床上下文,但直接应用弱定位的文本-图像线索(例如 CAM/CLIP 衍生信号)往往会产生粗糙的、斑块状的响应,模糊了边界,除非有额外的机制来恢复精细边缘。方法:我们提出 XBusNet,这是一种新颖的双提示、双分支多模态模型,它将图像特征与基于临床的文本相结合。一个基于 CLIP 视觉 Transformer 的全局通路编码以病灶大小和位置为条件的全图语义,而一个局部 U-Net 通路则强调精确边界,并由描述形状、边缘和乳腺影像报告和数据系统 (BI-RADS) 术语的提示进行调制。提示从结构化元数据中自动组装,无需手动点击。我们使用五折交叉验证在乳腺病变超声 (BLU) 数据集上进行评估。主要指标是 Dice 和交并比 (IoU);我们还进行了按尺寸分层分析和消融研究,以评估全局和局部路径以及文本驱动调制的作用。结果:XBusNet 在 BLU 数据集上取得了最先进的性能,平均 Dice 为 0.8765,IoU 为 0.8149,优于六个强大的基线模型。小病灶的增益最大,遗漏区域和虚假激活更少。消融研究显示了全局上下文、局部边界建模和基于提示的调制的互补贡献。结论:一种融合全局语义与局部精度的双提示、双分支多模态设计,能产生精确的 BUS 分割掩膜,并提高了对小尺寸、低对比度病灶的鲁棒性。
引用
@article{arxiv.2509.07213,
title = {XBusNet: Text-Guided Breast Ultrasound Segmentation via Multimodal Vision-Language Learning},
author = {Raja Mallina and Bryar Shareef},
journal= {arXiv preprint arXiv:2509.07213},
year = {2025}
}
备注
15 pages, 3 figures, 4 tables