FUSER:面向多视角点云注册的前馈Transformer与SE(3)$^N$扩散精炼
计算机视觉与模式识别
2026-04-28 v2
摘要
多视角点云注册通常依赖于广泛的两两配对匹配构建姿态图进行全局同步,这在计算上昂贵且在缺乏整体几何约束时本质上是病态的。本文提出FUSER,首个能够联合处理所有扫描的前馈式多视角注册Transformer,直接预测全局姿态,无需任何两两估计。为保持可计算性,FUSER通过稀疏3D CNN将每个扫描编码为低分辨率超点特征,保留绝对平移线索,并通过几何交替注意力模块实现高效的内部分与跨扫描推理。特别地,我们将2D注意力先验从现成基础模型迁移,以增强3D特征互动与几何一致性。基于FUSER,我们进一步引入FUSER-DF,一个SE(3)扩散精炼框架,用于通过在联合SE(3)空间中的去噪来纠正FUSER的估计。FUSER作为多视角注册模型构建去噪器,并推导了用于去噪监督的SE(3)变分下界。在3DMatch、ScanNet和ArkitScenes上的大规模实验表明,我们的方法在注册精度和计算效率方面取得优异表现。
关键词
引用
@article{arxiv.2512.09373,
title = {FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinement},
author = {Haobo Jiang and Jin Xie and Jian Yang and Liang Yu and Jianmin Zheng},
journal= {arXiv preprint arXiv:2512.09373},
year = {2026}
}
备注
Accepted to CVPR 2026 (Oral)