中文

面向三维形状隐表示的模态欧氏输入自监督生成-对比学习:一种动态切换方法

计算机视觉与模式识别 2025-06-09 v2

摘要

我们提出一种结合生成与对比的神经网络架构,用于学习三维体素形状的自监督隐表示。该架构对同一底层形状的体素网格与多视图图像使用两个编码器分支。核心思想是将所得隐表示之间的对比损失与额外的重建损失相结合。这有助于避免将隐表示坍缩为最小化对比损失的平凡解。一种新颖的动态切换方法用于以共享解码器交叉训练两个编码器。该切换方法还可对随机分支执行停止梯度操作。进一步的分类实验表明,以我们的自监督方法学到的隐表示隐式融合了来自额外输入数据的更有用信息,从而带来更好的重建与分类性能。

关键词

引用

@article{arxiv.2301.04612,
  title  = {Self-Supervised Generative-Contrastive Learning of Multi-Modal Euclidean Input for 3D Shape Latent Representations: A Dynamic Switching Approach},
  author = {Chengzhi Wu and Julius Pfrommer and Mingyuan Zhou and Jürgen Beyerer},
  journal= {arXiv preprint arXiv:2301.04612},
  year   = {2025}
}