LL3DA:面向全 3D 理解、推理与规划的视觉交互指令微调
计算机视觉与模式识别
2023-12-01 v1
摘要
大型多模态模型(LMM)近期的进展使其在人类-机器交互的各类应用中成为可能。然而,开发能够于复杂多样 3D 环境中理解、推理与规划的 LMM 仍具挑战性,尤其考虑到对 3D 场景的置换不变点云 3D 表示的理解需求。现有工作求助于多视图图像,并将 2D 特征投影至 3D 空间作为 3D 场景表示。然而,这导致巨大计算开销与性能退化。本文中,我们提出 LL3DA,一种以点点云为直接输入并响应文本指令与视觉提示的大型语言 3D 助手。这有助于 LMM 更好地理解人类交互,并进一步消除杂乱 3D 场景中的歧义。实验表明 LL3DA 取得显著结果,在 3D 密集描述与 3D 问答上均超越各类 3D 视觉-语言模型。
引用
@article{arxiv.2311.18651,
title = {LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning},
author = {Sijin Chen and Xin Chen and Chi Zhang and Mingsheng Li and Gang Yu and Hao Fei and Hongyuan Zhu and Jiayuan Fan and Tao Chen},
journal= {arXiv preprint arXiv:2311.18651},
year = {2023}
}
备注
Project Page: https://ll3da.github.io/