基于对比学习的超声声像视觉-语言对齐
计算机视觉与模式识别
2026-05-05 v1 机器学习
摘要
超声声像基础模型在结构化预测任务上取得了强大的性能,但仍局限于纯视觉方法,这限制了其在任务特定标注稀缺的零样迁移和少样本迁移。我们通过 EchoCare-CLIP,一种类似 CLIP 的双编码器对比框架,将超声图像与临床文本在共享嵌入空间中对齐。我们构建了一个覆盖乳腺、肝脏、肺部和甲状腺的多器官语料库,包含超过 16000 张图像-文本对,其中超过 78% 的描述来自专家标注的报告,其余部分则通过三级模板式和 LLM 生成式 caption 生成管道补充。我们评估了覆盖两大文本编码器族(CLIP、BioClinicalBERT)和两种 caption 策略(模板式、LLM 生成式)的模型配置,针对 OpenAI CLIP 和 BiomedCLIP 基线进行比较。我们的训练模型在跨模态对齐方面 consistently 优于基线,最佳配置实现了 0.682 的配对对齐得分。然而,更强的对齐并不必然导致更好的下游性能:基于 CLIP 的变体在部分微调情况下在外部 held-out 数据集上实现最强的零样本分类性能(BUSI 上为 0.709;AULI 上为 0.626),而完整端到端微调则因过拟合而削弱了迁移。线性探测和少样本适应中,模型排名依赖于数据集,反映了域适应与表征通用性之间的权衡。我们进一步表明,模板式 caption 能匹配或优于 LLM 生成式 caption,表明词汇多样性并非 caption 质量的可靠指标。综上所述,我们的结果表明,仅凭公共数据即可实现超声声像视觉-语言对齐,但实现稳健的临床迁移需要仔细平衡域适应、编码器容量和 caption 监督质量。
引用
@article{arxiv.2605.02126,
title = {Ultrasound Vision-Language Alignment via Contrastive Learning},
author = {Zhuoyang Lyu and Yiyang Zhang and Tongxin Wang and Ruirui Lan},
journal= {arXiv preprint arXiv:2605.02126},
year = {2026}
}