M3DBench:用多模态 3D 提示指令大模型
计算机视觉与模式识别
2023-12-19 v1
摘要
近年来,3D 理解变得流行,以促进自主智能体执行进一步的决策。然而,现有的 3D 数据集和方法通常局限于特定任务。另一方面,大语言模型和多模态语言模型的最新进展展示了卓越的通用语言和图像任务性能。因此,释放 MLM 成为更广泛任务的 3D 通用模型的潜力是很有意义的。然而,由于缺乏大规模 3D 指令跟随数据集,当前 MLM 的研究较少关注 3D 任务。在这项工作中,我们引入了一个名为 M3DBench 的综合 3D 指令跟随数据集,它具有以下特点:1) 它支持文本、图像、3D 对象和其他视觉提示交织的通用多模态指令。2) 它在区域和场景层面统一了各种 3D 任务,涵盖了真实世界 3D 环境中的多种基本能力。3) 它是一个包含超过 32 万个指令-响应对的大规模 3D 指令跟随数据集。此外,我们建立了一个新的基准,用于评估大模型在理解多模态 3D 提示方面的性能。大量实验证明了我们的数据集和基线的有效性,支持通用的以 3D 为中心的任务,这可以启发未来的研究。
引用
@article{arxiv.2312.10763,
title = {M3DBench: Let's Instruct Large Models with Multi-modal 3D Prompts},
author = {Mingsheng Li and Xin Chen and Chi Zhang and Sijin Chen and Hongyuan Zhu and Fukun Yin and Gang Yu and Tao Chen},
journal= {arXiv preprint arXiv:2312.10763},
year = {2023}
}