基于 Transformer 的深度腹腔镜立体匹配
计算机视觉与模式识别
2022-07-26 v1
摘要
自注意力机制与 transformer 结构相结合已在包括图像识别与目标检测在内的许多计算机视觉任务中展现出前景。尽管势头兴起,将 transformer 用于立体匹配问题仍相对未被探索。本文中,我们全面研究 transformer 在立体匹配问题中的使用,特别是针对腹腔镜视频,并提出一种新的混合深度立体匹配框架(HybridStereoNet),其在统一设计中结合了 CNN 与 transformer 的优势。具体而言,我们通过分析设计的损失景观与域内/域外精度,探讨了将 transformer 引入体立体匹配流水线的几种方式。我们的分析表明,采用 transformer 进行特征表示学习,同时使用 CNN 进行代价聚合,相较于其他方案将导致更快收敛、更高精度与更好泛化。我们在 Sceneflow、SCARED2019 与 dVPN 数据集上的大量实验证明了我们的 HybridStereoNet 的优越性能。
引用
@article{arxiv.2207.12152,
title = {Deep Laparoscopic Stereo Matching with Transformers},
author = {Xuelian Cheng and Yiran Zhong and Mehrtash Harandi and Tom Drummond and Zhiyong Wang and Zongyuan Ge},
journal= {arXiv preprint arXiv:2207.12152},
year = {2022}
}
备注
Accepted to MICCAI 2022; Xuelian Cheng and Yiran Zhong made equal contributions. Code:https://github.com/XuelianCheng/HybridStereoNet-main.git