跨视角注意力融合的视觉语言嵌入
计算机视觉与模式识别
2026-04-15 v1
摘要
视觉语言模型是开发开放词汇 2D 语义分割的关键。将这些模型从 2D 图像提升到 3D 场景仍是一个具有挑战性的问题。现有方法通常对 2D 描述符在多个视角上的反投影和平均,或在统计上选择单个代表性描述符,往往导致次优的 3D 表示。本文引入了一种新型多视角变换器架构,通过跨注意力融合来自多个视角的视觉语言描述符,并生成统一的每 3D 实例嵌入。作为第二个贡献,我们将多视角一致性作为自监督信号用于此融合,这在加入标准监督目标类损失后显著提升了性能。我们提出的跨视角注意力融合(CAMFusion)不仅在简单平均或单视角描述符选择方面持续领先,还在 3D 语义和实例分类基准测试中实现了领先的结果,包括在域外数据集上的零样本评估。
引用
@article{arxiv.2604.12551,
title = {Cross-Attentive Multiview Fusion of Vision-Language Embeddings},
author = {Tomas Berriel Martins and Martin R. Oswald and Javier Civera},
journal= {arXiv preprint arXiv:2604.12551},
year = {2026}
}