EndoMatcher:基于多域预训练的通用内镜图像匹配器用于机器人辅助手术
计算机视觉与模式识别
2025-08-08 v1
摘要
内镜图像中通用密集特征匹配对于机器人辅助任务(包括 3D 重建、导航和外科场景理解)至关重要。然而,由于困难的视觉条件(例如弱纹理、大的视角变化)以及标注数据的稀缺,这仍是一个挑战。为此,我们提出EndoMatcher,通过大规模、多域数据预训练实现通用内镜图像匹配器。为解决困难的视觉条件,EndoMatcher采用双分支视觉转换器提取多尺度特征,通过双向交互模块实现稳健的对应关系学习。为克服数据稀缺和提高域多样性,我们构建了 Endo-Mix6,即首个用于内镜匹配的多域数据集。Endo-Mix6 包含约 120 万真实和合成图像对,覆盖六个领域,使用结构从运动和仿真变换生成对应标签。Endo-Mix6 的多样性和规模引入了训练稳定性的新挑战,由于数据集大小、分布迁移和误差不平衡的显著变化。为此,我们采用渐进式多目标训练策略,以促进跨域的平衡学习并提高表示质量。这使得EndoMatcher能够以零样本方式在不可见的器官和成像条件下进行泛化。广泛的零样本匹配实验表明,EndoMatcher 在 Hamlyn 和 Bladder 数据集上分别比现有的SOTA方法提高了 140.69% 和 201.43% 的内点匹配数,并在 Gastro-Matching 数据集上将匹配方向预测准确率提高了 9.40%,在挑战性的内镜条件下实现密集且精确的匹配。代码已公开 https://github.com/Beryl2000/EndoMatcher。
引用
@article{arxiv.2508.05205,
title = {EndoMatcher: Generalizable Endoscopic Image Matcher via Multi-Domain Pre-training for Robot-Assisted Surgery},
author = {Bingyu Yang and Qingyao Tian and Yimeng Geng and Huai Liao and Xinyan Huang and Jiebo Luo and Hongbin Liu},
journal= {arXiv preprint arXiv:2508.05205},
year = {2025}
}