中文

Ross3D:具备3D感知的重构式视觉指令调优

计算机视觉与模式识别 2025-04-03 v1 人工智能 计算与语言 机器人学

摘要

大型多模态模型(LMMs)针对2D图像和视频的快速发展,推动了将这些模型应用于解释3D场景的努力。然而,缺乏大规模3D视觉语言数据集已成为显著障碍。为此,通常方法侧重于通过设计3D输入层次场景表示来将3D感知注入2D LMMs。本工作提供了新的视角。我们介绍了具备3D感知的重构式视觉指令调优(Ross3D),将3D感知的视觉监督集成到训练过程中。具体而言,它包含跨视图和全局视图重构。前者要求通过聚合其他视图的重叠信息来重构被遮挡的视图。后者旨在从所有可用视图中聚合信息,以恢复鸟瞰图图像,为整个场景提供全面概览。实验结果表明,Ross3D在各种3D场景理解基准测试中实现了最先进的性能。更重要的是,我们的半监督实验表明,Ross3D在利用大量无标签3D vision-only 数据方面具有显著潜力。

关键词

引用

@article{arxiv.2504.01901,
  title  = {Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness},
  author = {Haochen Wang and Yucheng Zhao and Tiancai Wang and Haoqiang Fan and Xiangyu Zhang and Zhaoxiang Zhang},
  journal= {arXiv preprint arXiv:2504.01901},
  year   = {2025}
}