面向内镜图像配准的自监督对比性嵌入适应
计算机视觉与模式识别
2025-12-12 v1
摘要
准确的空间理解对于图像导向手术、增强现实集成和情境感知至关重要。在微创手术过程中,视觉输入是唯一的内操作模态,建立内镜帧之间精确的像素级对应关系对于3D重建、摄像机跟踪和场景解释至关重要。然而,手术领域提出了 distinct 挑战:弱视角线索、非 Lambertian 组织反射以及复杂的可变形解剖结构会降低常规计算机视觉技术的性能。虽然深度学习模型在自然场景中表现出色,但其特征本身不适用于手术图像中细粒度匹配,需要针对该领域进行针对性适应。本研究提出了一种新型深度学习管道,用于在内镜图像对之间建立特征对应关系,同时提出了一种自监督优化框架用于模型训练。该方法利用新视角合成管道生成ground-truth 异常值对应关系,随后用于对比学习范式中的三元组挖掘。通过该自监督方法,我们将 DINOv2 主干网络增强了一个额外的 Transformer 层,专为产生便于通过余弦相似度阈值直接匹配的嵌入而优化。实验评估表明,我们的管道在 SCARED 数据集上超越了最新方法,实现了 improved 匹配精度和较低的极线误差。该提出的框架构成了更准确的手术内镜中高级计算机视觉应用的有价值贡献。
引用
@article{arxiv.2512.10379,
title = {Self-Supervised Contrastive Embedding Adaptation for Endoscopic Image Matching},
author = {Alberto Rota and Elena De Momi},
journal= {arXiv preprint arXiv:2512.10379},
year = {2025}
}