CapCLIP: 一种面向无线胶囊内镜分析的视觉-语言表征对齐方法
计算机视觉与模式识别
2026-05-12 v1
摘要
无线胶囊内镜(WCE)实现了对小肠的非侵入性视觉评估,但其临床实用性受到每次检查产生的大量帧以及在高变成像条件下识别细微异常的困难所限制。现有的基于学习的WCE方法主要是纯视觉的,通常局限于狭窄的病理集,并且在跨数据集和中心时表现出有限的迁移能力。为了解决这些限制,本研究引入了CapCLIP,一个面向WCE的领域特定视觉-语言表征学习框架。CapCLIP将胶囊内镜帧与源自标准化命名法和病理感知描述模板的临床基础文本描述对齐,从而学习既语义信息丰富又可迁移的嵌入。所提出的框架在严格的零样本条件下,使用未见过的WCE数据集,与相关的开源视觉和视觉-语言基础模型进行了评估。评估涵盖三个下游任务:K近邻分类、CLIP风格的图像-文本分类和文本到图像检索。在这些设置中,CapCLIP始终优于比较的基线,在分布外数据集上的零样本图像-文本分类和跨模态检索方面尤其表现出强劲的提升。结果表明,语言引导的表征学习可以改善WCE分析中的泛化能力和语义可解释性。这些发现将CapCLIP定位为迈向针对胶囊内镜定制的基础模型的一步,并支持使用语言基础的WCE分析。
引用
@article{arxiv.2605.08493,
title = {CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis},
author = {Haroon Wahab and Irfan Mehmood and Hassan Ugail},
journal= {arXiv preprint arXiv:2605.08493},
year = {2026}
}