Vid-LLM:一种基于重建-推理协同的紧凑视频式 3D 多模态大语言模型
计算机视觉与模式识别
2026-03-03 v4 人工智能
摘要
近期发展的多模态大语言模型(MLLMs)显著提升了 2D 域的视觉语言推理能力。然而,将这些能力扩展到 3D 场景理解仍是主要挑战。现有的 3D 多模态大语言模型(3D-MLLMs)往往依赖 3D 数据输入,这限制了其可扩展性和泛化能力。为克服这一限制,我们提出 Vid-LLM,一种基于视频的 3D-MLLM,直接处理视频输入而无需外部 3D 数据,使其在实际部署中更加实用。在我们的方法中,直接利用几何先验可提高场景感知性能。为将几何线索紧凑地整合到 MLLM 中,我们设计了一个 Cross-Task Adapter(CTA)模块,用于将 3D 几何先验与视觉语言表示对齐。为确保几何一致性和完整性,我们引入了 Metric Depth Model,从重建输出中恢复真实尺度的几何。最后,该模型采用两阶段蒸馏优化策略进行微调,实现快速收敛并稳定训练。广泛的实验在 diverse 基准测试上验证了我们方法的有效性,证明其在 3D 问答、3D 密集描述和 3D 视觉锚定任务中具备卓越的多任务能力。
引用
@article{arxiv.2509.24385,
title = {Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy},
author = {Haijier Chen and Bo Xu and Shoujian Zhang and Haoze Liu and Jiaxuan Lin and Jingrong Wang},
journal= {arXiv preprint arXiv:2509.24385},
year = {2026}
}