ToLL:用于 3D 场景图生成预训练的拓扑布局学习及非对称跨视图结构蒸馏
计算机视觉与模式识别
2026-04-21 v2
摘要
3D 场景图 (3DSG) 生成在空间理解和 affordance 感知中起到关键作用。为缓解数据稀缺导致的泛化问题,目前的做法提出了联合嵌入和生成式代理任务,用于在无谓词标签的数据集上预训练 3DSG 表示。然而,现有的生成式预训练通常会绕过联合嵌入中几何增强引起的语义腐化,但无法避免“几何捷径”问题:暴露稠密的对象空间和尺度先验会诱导模型通过插值对象位置来重建场景,从而忽略边缘提供的底层拓扑约束。为此,我们提出一种用于 3DSG 生成预训练框架的拓扑布局学习 (ToLL)。具体而言,我们设计了基于锚点的拓扑几何推理机制。它采用循环图神经网络 (GNN) 通过一个锚点结合稀疏空间先验,恢复以零居中子图 (不可见空间特征) 的全局布局。鉴于对象内部缺乏空间布局信息,该机制构建了信道瓶颈,迫使模型通过谓词表示学习来恢复完整场景布局。此外,我们构建了结构化多视图增强方案,以避免语义腐化,通过自蒸馏来提升 3DSG 表示。在特定数据集上的大量实验表明,我们的 ToLL 常常能提高 3DSG 相关质量,超越当前最先进的基线方法。
引用
@article{arxiv.2603.28178,
title = {ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining},
author = {Yucheng Huang and Luping Ji and Xiangwei Jiang and Wen Li and Mao Ye},
journal= {arXiv preprint arXiv:2603.28178},
year = {2026}
}
备注
Under Reivew