基于多层CLS标记融合的内窥镜图像分类对比学习框架
计算机视觉与模式识别
2025-09-03 v1
摘要
我们提出了一个针对ENT内窥镜图像分析的统一视觉语言框架,同时解决三个临床相关的任务:图像分类、图像到图像检索和文本到图像检索。不同于传统的基于卷积神经网络的管线难以捕获跨模态语义,我们的方法采用CLIP ViT-B/16作为 backbone,并通过低秩适配、多层CLS标记聚合和球形特征插值进行增强。这一组合使我们能够在有限的医学数据上实现高效微调,同时提高表征的多样性和跨模态语义对齐。为桥接视觉输入与文本诊断上下文之间的差距,我们引入基于类的自然语言提示,通过联合训练目标(由监督分类与对比学习组成)指导图像编码器。我们通过参与ACM MM'25 ENTRep大型挑战赛进行了验证,在分类方面实现了95%的准确率和F1分数,图像到图像检索的Recall@1为0.93和0.92,文本到图像检索的Recall@1为0.92,MRR分别为0.97和0.96。消融研究表明,每个架构组件都具有增量性益处,验证了我们在资源有限的临床环境中采用鲁棒的多模态医学理解框架的有效性。
引用
@article{arxiv.2509.00752,
title = {Multi-Level CLS Token Fusion for Contrastive Learning in Endoscopy Image Classification},
author = {Y Hop Nguyen and Doan Anh Phan Huu and Trung Thai Tran and Nhat Nam Mai and Van Toi Giap and Thao Thi Phuong Dao and Trung-Nghia Le},
journal= {arXiv preprint arXiv:2509.00752},
year = {2025}
}
备注
ACM Multimedia 2025