MambaTron:基于聚合选择状态空间建模的跨模态点云增强
计算机视觉与模式识别
2025-03-21 v1 机器学习
图像与视频处理
摘要
点云增强是从不完整输入生成高质量点云的过程,通过回归从参考(例如ground truth)填充缺失细节。除了单模态图像和点云重建,我们关注基于图像(代表点云视图)收集缺失信息以生成输出点云的视图引导点云完成任务。随着状态空间模型(尤其是Mamba)在自然语言处理及2D和3D视觉中的广泛应用,Mamba显示出作为自注意力机制的高效替代方案。然而,少数研究探索Mamba用于跨注意力处理图像和输入点云之间的跨模态问题。本文引入MambaTron,一种Mamba-Transformer单元,作为网络构建模块,具备单模态和跨模态重建能力,包括视图引导点云完成。我们通过MambaTron探索Mamba的长序列效率与Transformer卓越分析能力的结合优势。该方法是首次实现Mamba-based类跨注意力机制,尤其在计算机视觉中。我们的模型在使用少量计算资源的情况下,表现出与当前最先进技术相当的性能。
引用
@article{arxiv.2501.16384,
title = {MambaTron: Efficient Cross-Modal Point Cloud Enhancement using Aggregate Selective State Space Modeling},
author = {Sai Tarun Inaganti and Gennady Petrenko},
journal= {arXiv preprint arXiv:2501.16384},
year = {2025}
}
备注
Accepted to the Workshop on Image Quality in Computer Vision and Generative AI, WACV 2025