中文

序数内容变分自编码器:在深度潜变量模型中分离序数值内容因子

机器学习 2020-09-08 v1 人工智能 机器学习

摘要

在深度表示学习中,通常希望将特定因子(称为内容)与其他因子(称为风格)分离。内容通常由用户通过数据中的显式标签指定,而所有未标记/未知的因子被视为风格。最近,研究表明通过修改深度潜变量模型(如VAE)使得风格和内容在潜在表示中良好分离,可以有效利用此类内容标记数据。然而,该方法假设内容因子是分类值(例如,人脸图像中的主体ID,或MNIST数据集中的数字类别)。在某些情况下,内容是序数值,即内容因子取的值是有序的而非分类的,这使得内容标记VAE(包括它们推断的潜在空间)成为次优。本文提出了一种VAE的新扩展,在内容潜在空间中施加偏序集结构,同时使其与序数内容值对齐。为此,我们引入了一个条件高斯间距先验模型,取代先前方法中使用的独立同分布高斯潜在先验。该模型允许一个可处理的联合高斯先验,但同时也有效地将违反偏序约束的内容潜在配置的密度值置为可忽略。为了评估该模型,我们考虑了两个具体的序数结构问题:估计人脸图像中受试者的年龄和阐明食物图像中的卡路里含量。我们展示了在内容-风格分离方面相对于先前非序数方法的显著改进。

关键词

引用

@article{arxiv.2009.03034,
  title  = {Ordinal-Content VAE: Isolating Ordinal-Valued Content Factors in Deep Latent Variable Models},
  author = {Minyoung Kim and Vladimir Pavlovic},
  journal= {arXiv preprint arXiv:2009.03034},
  year   = {2020}
}