Ross3D:具备3D感知的重构式视觉指令调优
计算机视觉与模式识别
2025-04-03 v1 人工智能
计算与语言
机器人学
摘要
大型多模态模型(LMMs)针对2D图像和视频的快速发展,推动了将这些模型应用于解释3D场景的努力。然而,缺乏大规模3D视觉语言数据集已成为显著障碍。为此,通常方法侧重于通过设计3D输入层次场景表示来将3D感知注入2D LMMs。本工作提供了新的视角。我们介绍了具备3D感知的重构式视觉指令调优(Ross3D),将3D感知的视觉监督集成到训练过程中。具体而言,它包含跨视图和全局视图重构。前者要求通过聚合其他视图的重叠信息来重构被遮挡的视图。后者旨在从所有可用视图中聚合信息,以恢复鸟瞰图图像,为整个场景提供全面概览。实验结果表明,Ross3D在各种3D场景理解基准测试中实现了最先进的性能。更重要的是,我们的半监督实验表明,Ross3D在利用大量无标签3D vision-only 数据方面具有显著潜力。
引用
@article{arxiv.2504.01901,
title = {Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness},
author = {Haochen Wang and Yucheng Zhao and Tiancai Wang and Haoqiang Fan and Xiangyu Zhang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2504.01901},
year = {2025}
}