中文

Tripod:用于解耦表示学习的三种互补归纳偏置

机器学习 2024-05-28 v2 计算机视觉与模式识别

摘要

归纳偏置对于解耦表示学习中缩小未指定解集至关重要。在这项工作中,我们考虑为神经网络自编码器赋予来自文献的三个归纳偏置:通过量化将数据压缩成网格状潜在空间、潜在变量之间的集体独立性、以及任何潜在变量对其他潜在变量决定数据生成的最小功能影响。原则上,这些归纳偏置是深度互补的:它们最直接地分别指定了潜在空间、编码器和解码器的属性。然而在实践中,简单地组合实现这些归纳偏置的现有技术未能产生显著收益。为了解决这个问题,我们提出了对这三种技术的适应,简化了学习问题,为关键正则化项配备了稳定的不变性,并消除了退化激励。由此产生的模型Tripod在四个图像解耦基准测试中取得了最先进的结果。我们还验证了Tripod显著优于其朴素实现,并且其所有三条“腿”对于最佳性能都是必要的。

关键词

引用

@article{arxiv.2404.10282,
  title  = {Tripod: Three Complementary Inductive Biases for Disentangled Representation Learning},
  author = {Kyle Hsu and Jubayer Ibn Hamid and Kaylee Burns and Chelsea Finn and Jiajun Wu},
  journal= {arXiv preprint arXiv:2404.10282},
  year   = {2024}
}

备注

ICML 2024 camera-ready. 22 pages, 10 figures, code available at https://github.com/kylehkhsu/tripod