桥形:用于3D形状完善的潜在扩散薛定谔桥
计算机视觉与模式识别
2026-03-18 v2
摘要
现有的基于扩散的方法的3D形状完善通常采用条件范式,通过深度特征交互(如拼接、跨注意力)将不完整的形状信息注入去噪网络,以引导采样趋向完善的形状,常以基于体素的距离函数表示。然而,这些方法未能显式建模最优全局传输路径,导致完善效果次优。此外,直接在体素空间进行扩散受分辨率约束,限制了细粒度几何细节的生成。为此,我们提出桥形(BridgeShape),一种通过潜在扩散薛定谔桥实现3D形状完善的新框架。其核心创新在于两个方面:(i) 桥形将形状完善表述为最优传输问题,显式建模不完整与完善形状之间的转换,以确保全局一致的变换。(ii) 我们引入深度增强向量量化变分自编码器(Depth-Enhanced VQ-VAE),将3D形状编码到紧凑的潜在空间,利用自投影多视图深度信息搭配强大的DINOv2特征,增强几何结构感知。通过在紧凑且结构信息丰富的潜在空间中操作,桥形有效缓解了分辨率约束,实现更高效、更高保真的3D形状完善。桥形在大规模3D形状完善基准测试中实现了最新性能,展现出在更高分辨率和未见对象类别下 superior 保真度。
引用
@article{arxiv.2506.23205,
title = {BridgeShape: Latent Diffusion Schr\"odinger Bridge for 3D Shape Completion},
author = {Dequan Kong and Honghua Chen and Zhe Zhu and Mingqiang Wei},
journal= {arXiv preprint arXiv:2506.23205},
year = {2026}
}
备注
Accepted by AAAI2026