Chat-3D:数据高效地微调大语言模型以实现三维场景的通用对话
计算机视觉与模式识别
2023-08-21 v1
摘要
三维场景理解因广泛应用而受到显著关注。然而,现有的三维场景理解方法局限于特定下游任务,阻碍了其在现实应用中的实用性。本文提出 Chat-3D,它结合了预训练三维表示的视觉感知能力与先进 LLM(大语言模型)的卓越推理和对话能力,实现了首个面向三维场景的通用对话系统。具体而言,我们将三维表示对齐到 LLM 的特征空间中,从而使 LLM 能够感知三维世界。鉴于三维场景-文本数据的稀缺性,我们提出三阶段训练策略以高效利用可用数据实现更好的对齐。为增强推理能力并设计用户友好的交互方案,我们进一步构建了高质量的对象中心三维指令数据集,并设计了相应的对象中心提示。我们的实验表明,Chat-3D 具备理解三维场景多样指令、进行复杂空间推理并将外部知识纳入回答的出色能力。在构建的指令数据集上,Chat-3D 相对于 GPT-4 取得了 75.6% 的相对得分。
引用
@article{arxiv.2308.08769,
title = {Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes},
author = {Zehan Wang and Haifeng Huang and Yang Zhao and Ziang Zhang and Zhou Zhao},
journal= {arXiv preprint arXiv:2308.08769},
year = {2023}
}
备注
The project page is \url{https://chat-3d.github.io/}