基于误差驱动的 3D 场景编辑在大语言模型中的场景定位
计算机视觉与模式识别
2025-11-19 v1 人工智能
计算与语言
摘要
尽管近期在 3D-LLM 方面取得了进展,但它们在准确将语言锚定到 3D 环境中的视觉和空间元素方面仍受限。这一局限部分源于训练数据聚焦于语言推理而非空间理解,因为稀缺的 3D 资源导致潜在的场景定位偏差未能得到解决。为此,我们提出将 3D 场景编辑作为生成精确视觉反事实情形的关键机制,以通过细粒度的空间操作来缓解这些偏差,而无需进行昂贵的场景重建或大规模的 3D 数据收集。此外,为使这些编辑具有针对性且直接解决模型特定弱点的所在,我们引入了 DEER-3D——一个遵循“分解、诊断评估、编辑、再训练”结构化工作流程的误差驱动框架,而在常规方法中则是广泛或随机地增强数据。具体而言,当我们识别 3D-LLM 的一次场景定位失效后,本框架首先诊断出确切的谓词级错误(例如属性或空间关系),然后执行与谓词对齐的最小化 3D 场景编辑(如重新着色或重新定位),以生成针对性的反事实监督用于迭代模型微调,从而显著提升定位准确性。我们在多个用于 3D 场景定位和场景理解任务的基准测试上评估了该编辑流程,通过迭代细化在所有评估数据集上 consistently 实现了改进。DEER-3D 凸显了在大语言模型中通过针对性、误差驱动的场景编辑桥接语言推理能力与空间定位能力的有效性。
引用
@article{arxiv.2511.14086,
title = {Error-Driven Scene Editing for 3D Grounding in Large Language Models},
author = {Yue Zhang and Zun Wang and Han Lin and Jialu Li and Jianing Yang and Yonatan Bitton and Idan Szpektor and Mohit Bansal},
journal= {arXiv preprint arXiv:2511.14086},
year = {2025}
}
备注
Code: https://github.com/zhangyuejoslin/Deer-3D