CrossView Suite:通过数据集、模型与基准 harnessing MLLMs 的跨视角空间智能
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
空间智能要求多模态大语言模型(MLLMs)超越单视角感知,在多个视角下对物体、可见性、几何形状及交互进行一致性推理。然而,跨视角推理的进展仍受限于三大差距:大规模高质量标注训练数据的稀缺,用于系统评估的全面基准的缺乏,以及建立跨视角物体级一致性的显式对齐机制的缺失。为解决这些差距,我们全面开发了 CrossView Suite,包含三个协同的组件:CrossViewSet、CrossViewBench 和 CrossViewer。首先,我们引入一个多智能体数据引擎,精心构建了一个大规模、高质量的跨视角指令数据集,称为 CrossViewSet,涵盖 17 种细粒度任务类型,共 160 万个样本。其次,我们精心创建了场景互斥的 CrossViewBench,以全面评估 MLLM 的跨视角空间理解能力,并从多个方面对其进行评测。最后,我们提出了 CrossViewer,一个用于 MLLMs 跨视角空间推理的渐进式三阶段框架,遵循“感知 -> 对齐 -> 推理”范式。我们的方法配备了一个自适应空间区域分词器以捕获细粒度物体表示,随后显式对齐多视角物体,进而融合对齐后的特征以提升 MLLMs 的跨视角推断能力。大量实验与分析表明,大规模训练数据、系统性评估以及显式的跨视角对齐,对于推动 MLLMs 从单视角感知迈向真实世界空间智能至关重要。项目页面可在 https://github.com/Thinkirin/Crossview-Suite 获取。
引用
@article{arxiv.2605.18621,
title = {CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark},
author = {Wei Wang and Yuqian Yuan and Tianwei Lin and Wenqiao Zhang and Siliang Tang and Jun Xiao and Yueting Zhuang},
journal= {arXiv preprint arXiv:2605.18621},
year = {2026}
}