超越空间压缩:面向开放世界3D结构的以接口为中心的生成状态
机器学习
2026-05-12 v1 计算机视觉与模式识别
摘要
当前的3D分词器在很大程度上将表示视为空间压缩:紧凑的编码重建表面几何,但隐含了组件所有权和连接有效性。在具有相交组件、噪声拓扑和弱规范结构的开放世界资产中,这造成了表示不匹配:局部形状、组件身份和装配关系在潜在流中纠缠在一起,并且在解码过程中无法原生寻址。我们提出了一种替代观点:以接口为中心的生成状态,其中分词化构建了一个操作状态,而不是一个被动的压缩编码。该状态将局部几何、组件所有权和连接有效性暴露为可在解码过程中查询、约束和修复的变量。我们通过组件条件规范局部令牌(C2LT-3D)实例化了该公式,将表示分解为规范局部几何、分区条件上下文和关系接缝变量。每个因子针对压缩中心令牌的不同失败模式:姿态泄漏、跨组件干扰或无效局部连接。这种暴露的状态支持连接验证、潜在结构修复、定向干预和约束序列化,而无需单独的事后结构恢复模块。在单对象CAD模型上训练,并在开放世界多组件资产上进行零样本评估,C2LT-3D提高了结构鲁棒性,并表明其潜在变量在对抗性连接设置下仍然可操作。这些结果表明,开放世界3D生成表示不仅应根据重建保真度进行评估,还应根据其离散状态是否对装配级结构推理保持可操作性来评估。
引用
@article{arxiv.2605.10438,
title = {Beyond Spatial Compression: Interface-Centric Generative States for Open-World 3D Structure},
author = {Xiang Chen and Alexander Binder},
journal= {arXiv preprint arXiv:2605.10438},
year = {2026}
}