基于多模态表示学习协同知识用于结肠息肉重识别
计算机视觉与模式识别
2025-10-22 v3
摘要
结肠镜息肉重识别旨在从大型图库中匹配同一息肉,该图库包含使用不同镜头和不同相机拍摄的图像,这在计算机辅助诊断中对于预防和治疗结直肠癌具有重要作用。然是,传统方法直接采用在 ImageNet 数据集上训练的 CNN 模型进行对象重识别,由于域间差距较大,往往在结肠镜数据集上产生不理想的检索性能。更糟的是,这些解决方案通常仅基于视觉样本学习单一模态表征,无法探索来自其他不同模态的互补信息。为此,我们提出一种新型深度多模态协同学习框架,命名为 DMCL,用于息肉重识别,能够有效鼓励多模态知识协同并在医疗场景中增强泛化能力。基于此,我们引入动态多模态特征融合策略,通过端到端训练利用优化后的视觉-文本表征进行多模态融合。在标准基准测试上的实验表明,多模态设置相对于最先进的单模态重识别模型具有优势,尤其在结合多模态协同融合策略时效果更为突出。代码已公开于 https://github.com/JeremyXSC/DMCL。
引用
@article{arxiv.2408.05914,
title = {Learning Collaborative Knowledge with Multimodal Representation for Polyp Re-Identification},
author = {Suncheng Xiang and Jiale Guan and Shilun Cai and Jiacheng Ruan and Dahong Qian},
journal= {arXiv preprint arXiv:2408.05914},
year = {2025}
}