中文

HTMNet:一种基于 Transformer-Mamba 瓶颈多模态融合的混合网络用于透明与反射物体深度补全

计算机视觉与模式识别 2025-05-29 v2

摘要

透明和反射物体对深度传感器构成了重大挑战,导致深度信息不完整,进而对下游机器人感知与操作任务产生不利影响。为了解决这一问题,我们提出了 HTMNet,一种融合 Transformer、CNN 和 Mamba 架构的新型混合模型。编码器基于双分支 CNN-Transformer 框架,瓶颈融合模块采用 Transformer-Mamba 架构,解码器构建于多尺度融合模块之上。我们引入了一个基于自注意力机制和状态空间模型的新型多模态融合模块,标志着 Mamba 架构在透明物体深度补全领域的首次应用,并展现了其巨大的潜力。此外,我们为解码器设计了一个创新的多尺度融合模块,该模块结合了通道注意力、空间注意力和多尺度特征提取技术,通过下采样融合策略有效整合多尺度特征。在多个公开数据集上的广泛评估表明,我们的模型实现了 SOTA 性能,验证了本方法的有效性。

关键词

引用

@article{arxiv.2505.20904,
  title  = {HTMNet: A Hybrid Network with Transformer-Mamba Bottleneck Multimodal Fusion for Transparent and Reflective Objects Depth Completion},
  author = {Guanghu Xie and Yonglong Zhang and Zhiduo Jiang and Yang Liu and Zongwu Xie and Baoshi Cao and Hong Liu},
  journal= {arXiv preprint arXiv:2505.20904},
  year   = {2025}
}