Robin3D: 通过稳健指令调优提升 3D 大语言模型
人工智能
2025-02-21 v2 计算与语言
计算机视觉与模式识别
摘要
近期 3D 大语言模型(3DLLM)的发展凸显了其在构建 3D 现实世界通用智能体方面的潜力,但由于缺乏高质量稳健指令数据,导致其判别能力和泛化能力受限。本文引入 Robin3D,该模型在由我们新开发的数据引擎(Robust Instruction Generation, RIG)生成的大规模指令数据上进行训练。RIG 生成两类关键指令数据:1)对抗指令数据,包含混合负样本和正样本以增强模型的判别理解;2)多样化指令数据,包含多种指令风格以提升模型的泛化能力。最终构建 100 万条指令数据,包括 34.4 万条对抗样本、50.8 万条多样化样本和 16.5 万条基准训练集样本。为更好地处理这些复杂指令,Robin3D 首先引入关系增强投影器以增强空间理解,然后通过 ID-Feature Bonding 强化对象指代和定位能力。Robin3D 在五个广泛使用的 3D 多模态学习基准测试中均表现优于先前方法,无需任务特定微调。值得注意的是,在定位任务(Multi3DRefer)上实现 7.8% 的提升,在描述任务(Scan2Cap)上实现 6.9% 的提升。
引用
@article{arxiv.2410.00255,
title = {Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning},
author = {Weitai Kang and Haifeng Huang and Yuzhang Shang and Mubarak Shah and Yan Yan},
journal= {arXiv preprint arXiv:2410.00255},
year = {2025}
}
备注
8 pages