Tell2Reg: 利用相同语言提示在图像之间建立空间对应关系
计算机视觉与模式识别
2025-02-06 v1 人工智能
图像与视频处理
摘要
空间对应关系可以由成对的分割区域表示,图像配准网络旨在分割对应的区域而非预测位移场或变换参数。本文展示,该对应的区域对可通过同一语言提示在两个不同图像上使用基于 GroundingDINO 和 SAM 的预训练大型多模态模型进行预测。这实现了完全自动且无需训练的配准算法,可推广到广泛的图像配准任务。本文 presented 使用其中一项具有挑战性的任务进行实验结果,即注册患者间高度可变强度和形态的前列腺 MR 图像。Tell2Reg 无需训练,消除了以往该配准任务需要昂贵且耗时的图像标注。该方法优于基于无监督学习的配准方法,其性能与弱监督方法相当。另外,还 presented 定性结果,表明首次发现语言语义与空间对应性之间可能存在关联,包括语言提示区域中的空间不变性以及所获局部和全局对应性之间语言提示差异。代码地址为 https://github.com/yanwenCi/Tell2Reg.git。
引用
@article{arxiv.2502.03118,
title = {Tell2Reg: Establishing spatial correspondence between images by the same language prompts},
author = {Wen Yan and Qianye Yang and Shiqi Huang and Yipei Wang and Shonit Punwani and Mark Emberton and Vasilis Stavrinides and Yipeng Hu and Dean Barratt},
journal= {arXiv preprint arXiv:2502.03118},
year = {2025}
}
备注
5 pages, 3 figures, conference paper