中文

面向 LLM 条件化结构化室内预测的粗糙语义注入

计算机视觉与模式识别 2026-05-19 v1

摘要

大语言模型(LLM)最近被用作从 3D 点云输入进行室内理解的结构化解码器。然而,点云编码器在体素化和稀疏池化后往往对薄型结构元素(如门和窗)表征不足,可能在杂乱场景中遗漏单个家具实例。我们提出一种保持接口的语义增强方法,用于 LLM 条件化的结构化解码。核心思想是将语义证据与点云表示关联,将其简化为四组编码(家具、墙壁、开口和其他),并将其编码为 RGBB 点接口:红色代表家具,绿色代表墙壁,蓝色代表开口,黑色代表其他,其中 RGBB 表示由三个 RGB 通道表示的四种语义颜色状态,而非额外的第四个通道。这种语义颜色代码附加到原始原始点属性上,随后进行标记化,以便几何和语义在相同的稀疏标记化路径上,而下游语言模型解码器和输出序列化保持不变。我们进一步引入一种轻量级路由语义位移模块,辅助头仅用于训练时的比例/预算正则化和分析,以强化稀疏池化后的语义线索。在这些受控语义来源设置下,报告的指标在 Structured3D、SpatialLM 数据集和 ARKitScenes 上均有所提高,尤其是在开口定位和杂乱场景中对单个家具检测方面。消融实验阐明了语义来源、颜色编码、标记融合和位移注入的作用,同时表明颜色/熵效应仍具有显著意义。

关键词

引用

@article{arxiv.2605.16832,
  title  = {Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction},
  author = {Shuliang Zhu and Tomiwa Adey and Jinjia Zhou},
  journal= {arXiv preprint arXiv:2605.16832},
  year   = {2026}
}