中文

CoSMo3D:通过 LLM 指导的全息可提示 3D 语义零件分割

计算机视觉与模式识别 2026-03-03 v1

摘要

开放世界可提示 3D 语义分割仍然脆弱,因为语义是在输入传感器坐标中推断的。然而,人类则通过功能角色在规范空间中解释零件——翅膀向后延伸,把手向侧面凸出,腿部从下面支撑。心理学证据表明,我们会将物体 mentally rotate 到规范框架中以揭示这些角色。为填补这一差距,我们提出了 \methodName{},通过从数据中直接学习的潜在规范参考框架来实现规范空间感知。通过设计,我们通过 LLM 指导的 intra-和 cross-category alignment 创建了统一的规范数据集,暴露了 200 个类别之间的规范空间规律。通过归纳,我们在模型内部通过双分支架构实现规范性,采用规范地图锚定和规范盒校准,将姿态变异和对称性折叠到稳定的规范嵌入中。这一从输入姿态空间向规范嵌入的转变导致零件语义更加稳定和可迁移。实验结果表明,\methodName{} 在开放世界可提示 3D 分割方面取得了新的 state of the art 成绩。

关键词

引用

@article{arxiv.2603.01205,
  title  = {CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling},
  author = {Li Jin and Weikai Chen and Yujie Wang and Yingda Yin and Zeyu Hu and Runze Zhang and Keyang Luo and Shengju Qian and Xin Wang and Xueying Qin},
  journal= {arXiv preprint arXiv:2603.01205},
  year   = {2026}
}