中文

面向视觉空间认知的层次化融合:ViCA2 架构

计算机视觉与模式识别 2025-09-10 v4 人工智能 计算与语言 机器学习 机器人学

摘要

虽然多模态大语言模型(MLLM)在通用视觉语言任务中表现优异,但视觉空间认知——即对空间布局、关系和动态进行推理——仍是一大挑战。现有模型往往缺乏必要的架构组件和专业训练数据以实现细粒度的空间理解。我们引入 ViCA2(Visuospatial Cognitive Assistant 2),一种新型 MLLM,旨在增强空间推理能力。ViCA2 采用双视觉编码器架构,集成 SigLIP 用于语义表示和 Hiera 用于空间结构,配合 token 比例控制机制提升效率。我们还开发了 ViCA-322K 数据集,这一大规模数据集包含超过 32.2 万组带空间约束的问答对,用于针对性指令微调。在具有挑战性的 VSI-Bench 数据集上,ViCA2-7B 模型实现了 56.8 的最高平均得分,显著优于更大规模的开源模型(如 LLaVA-NeXT-Video-72B,40.9)和领先的专有模型(Gemini-1.5 Pro,45.4)。这表明我们的方案在保持模型紧凑性的同时,能够实现强大的视觉空间智能。我们将发布 ViCA2、其代码及 ViCA-322K 数据集,以促进进一步的研究。

关键词

引用

@article{arxiv.2505.12363,
  title  = {Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts},
  author = {Qi Feng},
  journal= {arXiv preprint arXiv:2505.12363},
  year   = {2025}
}

备注

26 pages, 19 figures, 4 tables