中文

HyperPointFormer:基于双分支交叉注意力 Transformer 的 3D 空间多模态融合

计算机视觉与模式识别 2025-11-25 v1

摘要

多模态遥感数据(包括光谱与激光雷达或摄影测量)对于在城市场景中获得满意的地表利用/地表覆盖分类结果至关重要。迄今为止,大多数研究在 2D 语境下进行。当数据集中存在 3D 信息时,通常通过将 3D 数据栅格化为 2D 格式来与 2D 数据集成。尽管该方法能产生满意的分类结果,但由于限制了模型直接从原始点云学习 3D 空间特征的能力,它在充分利用 3D 数据潜力方面存在不足。此外,由于输入数据的维度被降低,它也限制了 3D 预测的生成。在本研究中,我们提出了一种完全基于 3D 的方法,将所有模态融合在 3D 点云中,并采用专用的双分支 Transformer 模型来同时学习几何和光谱特征。为了增强融合过程,我们引入了一种完全在 3D 点上运行的基于交叉注意力的机制,有效地整合了跨多个尺度的各种模态的特征。交叉注意力的目的是允许一种模态通过权衡相关特征来评估另一种模态的重要性。我们使用 2018 年 IEEE GRSS 数据融合竞赛 (DFC2018) 数据集,通过将我们的方法与 3D 和 2D 方法进行比较来评估其性能。我们的研究结果表明,与 2D 方法相比,3D 融合提供了具有竞争力的结果,并通过提供 3D 预测提供了更大的灵活性。这些预测可以投影到 2D 地图上,而反向操作是不可行的。此外,我们还在不同的数据集上评估了我们的方法,特别是 ISPRS Vaihingen 3D 和 IEEE 2019 数据融合竞赛数据集。我们的代码将发布于此:https://github.com/aldinorizaldy/hyperpointformer。

关键词

引用

@article{arxiv.2505.23206,
  title  = {HyperPointFormer: Multimodal Fusion in 3D Space with Dual-Branch Cross-Attention Transformers},
  author = {Aldino Rizaldy and Richard Gloaguen and Fabian Ewald Fassnacht and Pedram Ghamisi},
  journal= {arXiv preprint arXiv:2505.23206},
  year   = {2025}
}