3D-GRAND:百万级3D-LLM数据集,实现更好的接地与更少的幻觉
计算机视觉与模式识别
2025-03-24 v3 人工智能
计算与语言
机器学习
机器人学
摘要
语言与3D感知的融合对于能够理解并与物理世界交互的具身智能体和机器人至关重要。尽管大语言模型(LLMs)展示了令人印象深刻的语言理解和生成能力,但它们对3D环境(3D-LLMs)的适应仍处于早期阶段。一个主要挑战是缺乏具有语言与3D场景之间密集接地的大规模数据集。我们引入了3D-GRAND,这是一个开创性的大规模数据集,包含40,087个家庭场景,配有620万条密集接地的场景-语言指令。我们的结果表明,使用3D-GRAND进行指令微调显著增强了3D-LLMs的接地能力并减少了幻觉。作为我们贡献的一部分,我们提出了一个全面的基准3D-POPE,用于系统评估3D-LLMs中的幻觉,从而实现模型的公平比较。我们的实验揭示了数据集规模与3D-LLM性能之间的缩放效应,强调了大规模3D-文本数据集对具身AI研究的重要性。我们的结果展示了有效的模拟到现实迁移的早期信号,表明在大型合成数据上训练的模型可以在真实世界的3D扫描上表现良好。通过3D-GRAND和3D-POPE,我们旨在为具身AI社区提供资源和见解,以引领更可靠、接地更好的3D-LLMs。项目网站:https://3d-grand.github.io
引用
@article{arxiv.2406.05132,
title = {3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination},
author = {Jianing Yang and Xuweiyi Chen and Nikhil Madaan and Madhavan Iyengar and Shengyi Qian and David F. Fouhey and Joyce Chai},
journal= {arXiv preprint arXiv:2406.05132},
year = {2025}
}
备注
CVPR 2025. Project website: https://3d-grand.github.io