SSR3D-LLM:通过潜在步骤实现结构化空间推理,用于统一 3D-LLM 中的精细定位
计算机视觉与模式识别
2026-05-28 v1 人工智能
摘要
3D 物体定位从自然语言中对 3D 场景中的指称对象进行定位。统一的实例中心 3D-LLM 旨在同时解决定位、对话、问答和描述任务,但许多方法仅依赖单一指针式定位决策,将关系指令压缩为一次选择。这对需要通过上下文对象和空间关系排除多个同类候选者的精细查询而言不稳妥。我们提出了结构化空间推理 3D-LLM(SSR3D-LLM),一种用于统一 3D-LLM 的结构化定位界面。给定固定的 Mask3D 对象提案,LLM 从查询中编写一序列潜在空间推理步骤和记忆标记,几何感知评分器按顺序读取这些潜在步骤,以分步方式 refined candidate rankings。潜在步骤在训练时通过标准基准目标监督和辅助指涉线索监督学习,而推理仅使用输入查询和 Mask3D 提案。在 ReferIt3D、ScanRefer 和 Multi3DRef 上,SSR3D-LLM 在统一 3D-LLM 基线中取得最强结果,相较于单指针 QPG 基线在精细定位上实现显著提升,并在保持默认语言任务路径的同时持续改进所有先前统一 3D-LLM 的表现。
引用
@article{arxiv.2605.28490,
title = {SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs},
author = {Jiawei Li and Ziyi Liu and Weijie Shi and Long Chen and Jiajie Xu and Xiaofang Zhou},
journal= {arXiv preprint arXiv:2605.28490},
year = {2026}
}