Shape:面向工业 CAD 分析的自监督 3D 几何基础模型
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
工业 CAD 工作流程需要稳健、可泛化的 3D 几何表征,支持精确性和可解释性。我们提出Shape,一个自监督基础模型,将表面网格转换为稠密 per-token 嵌入。Shape 融合了结构化 3D 隐式网格、多尺度几何感知 tokenizer(MAGNO)以及基于分组查询注意力和 RMSNorm 的 transformer 处理器。通过学习的重建先验,可实现 per-region attribution,以提供可解释预测。预训练使用归一化几何统计信息的掩码 token 重建和多分辨率对比一致性。109 万参数的 backbone 在 61,052 个 CAD 网格(来自 Thingi10K、MFCAD 和 Fusion360)上进行预训练。在 2,983 个 held-out 网格上的评估显示,Shape 实现了 R2 = 0.729 的重建率和 98.1% 的 top-1 检索率,under Wang-Isola protocol,且几乎不存在重建 train/val gap(对比得分使用更大的评估池)。对损失类型和目标空间归一化的 2x2 消验显示,per-dimension 归一化至关重要:若无此归一化,性能崩溃(R2 < 0.14,top-1 < 88%);若有此归一化,两种损失均成功(R2 > 0.70,top-1 > 96%)。Smooth-L1 提供次要稳定性。代码、嵌入及交互式演示已发布于 https://github.com/simd-ai/shape。
引用
@article{arxiv.2604.22825,
title = {SGP-SAM: Self-Gated Prompting for Transferring 3D Segment Anything Models to Lesion Segmentation},
author = {Zixuan Tang and Shen Zhao},
journal= {arXiv preprint arXiv:2604.22825},
year = {2026}
}