利用 spatial-VAE 显式解耦图像内容与平移和旋转
计算机视觉与模式识别
2019-09-27 v1 机器学习
定量方法
摘要
给定图像数据集,我们常常希望找到将数据生成因子编码为独立于旋转和平移等位姿变量的语义内容。然而,当前的解耦方法并未对学到的潜表示施加任何特定结构。我们提出一种在变分自编码器 (VAE) 框架中显式地将图像旋转和平移与其他非结构化潜因子解耦的方法。通过将生成模型表述为空间坐标的函数,我们使重建误差相对于潜平移和旋转参数可微。该表述允许我们训练神经网络对这些潜变量执行近似推断,同时显式约束它们仅表示旋转和平移。我们证明,这一称为 spatial-VAE 的框架有效地学到了将图像旋转和平移与内容解耦的潜表示,并在多个基准数据集上改善了相对于标准 VAE 的重建,包括应用于对单粒子电子显微镜中蛋白质的连续二维视图以及天文图像中的星系进行建模。
引用
@article{arxiv.1909.11663,
title = {Explicitly disentangling image content from translation and rotation with spatial-VAE},
author = {Tristan Bepler and Ellen D. Zhong and Kotaro Kelley and Edward Brignole and Bonnie Berger},
journal= {arXiv preprint arXiv:1909.11663},
year = {2019}
}
备注
11 pages, 6 figures, to appear in the 33rd Conference on Neural Information Processing Systems (NeurIPS 2019)