FusionBERT:通过交叉注意力视觉融合与法线感知 3D 编码器的多视角图像-3D 检索
计算机视觉与模式识别
2026-04-06 v1
摘要
我们提出了 FusionBERT,一个用于图像-3D 多模态检索的新型多视角视觉融合框架。现有的图像-3D 表示学习方法主要聚焦于单个物体图像与其 3D 模型的特征对齐,限制了其在物体通常从多个视角被观察和捕捉的真实场景中的适用性。虽然多视角观察自然地提供了互补的几何和外观线索,但现有的多模态大模型很少探索如何有效融合此类多视角视觉信息以实现更好的跨模态检索。为解决这一局限,我们引入了一个名为 FusionBERT 的多视角图像-3D 检索框架,它创新性地利用基于交叉注意力的多视角视觉聚合器来自适应地整合物体多视角图像的特征。所提出的多视角视觉编码器融合视角间的互补关系,并选择性地在多个视角中强调信息丰富的视觉线索,以获得更稳健融合的视觉特征,从而实现更好的 3D 模型匹配。此外,FusionBERT 提出了一种法线感知 3D 模型编码器,通过联合编码点法线和 3D 位置来进一步增强物体模型的 3D 几何特征,为无纹理或颜色退化的 3D 模型实现更稳健的表示学习。广泛的图像-3D 检索实验表明,FusionBERT 在单视角和多视角设置下均显著优于 SOTA 多模态大模型,为多视角多模态检索建立了强有力的基准。
引用
@article{arxiv.2604.02583,
title = {FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder},
author = {Wei Li and Yufan Ren and Hanqing Jiang and Jianhui Ding and Zhen Peng and Leman Feng and Yichun Shentu and Guoqiang Xu and Baigui Sun},
journal= {arXiv preprint arXiv:2604.02583},
year = {2026}
}
备注
9 pages, 6 figures, 2 tables