中文

基于平移与旋转群等变VAE的无监督物体表征学习

计算机视觉与模式识别 2023-01-05 v2 机器学习

摘要

在许多成像模态中,感兴趣物体可能出现在各种位置和姿态(即在二维或三维中经历平移和旋转),但物体的位置和姿态并不改变其语义(即物体的本质)。也就是说,卫星图像中飞机的具体位置和旋转、自然图像中椅子的三维旋转,或冷冻电镜中粒子的旋转,都不会改变这些物体的内在性质。在此,我们考虑以完全无监督的方式学习对姿态和位置不变的物体语义表征的问题。我们通过引入TARGET-VAE(一种平移和旋转群等变变分自编码器框架)来解决先前方法在此问题上的不足。TARGET-VAE结合了三项核心创新:1)平移和旋转群等变编码器架构;2)在潜在旋转、平移以及旋转-平移不变语义物体表征上的结构解耦分布,这些由近似推断网络联合推断;3)空间等变生成器网络。在综合实验中,我们表明TARGET-VAE在无监督情况下学习到解耦表征,显著优于并避免了先前方法的缺陷。当在受旋转和平移严重破坏的图像上训练时,TARGET-VAE学习到的语义表征与在姿态一致物体上学习到的相似,大幅改善了语义潜在空间中的聚类。此外,TARGET-VAE能够进行极为准确的无监督姿态与位置推断。我们期望诸如TARGET-VAE的方法将支撑未来无监督物体生成、姿态预测和物体检测的方法。

关键词

引用

@article{arxiv.2210.12918,
  title  = {Unsupervised Object Representation Learning using Translation and Rotation Group Equivariant VAE},
  author = {Alireza Nasiri and Tristan Bepler},
  journal= {arXiv preprint arXiv:2210.12918},
  year   = {2023}
}