中文

VDSM:基于状态空间建模与深度混合专家的无监督视频解耦

计算机视觉与模式识别 2021-12-16 v3 机器学习

摘要

解耦表示支持一系列下游任务,包括因果推理、生成建模和公平机器学习。遗憾的是,已有研究表明,若不引入监督或归纳偏置,解耦是不可能的。鉴于监督通常昂贵或难以获取,我们选择引入结构性归纳偏置,并提出一种无监督的深度状态空间模型用于视频解耦(VDSM)。该模型通过引入具有动态先验和混合专家解码器的层次结构,解耦潜在的时变与动态因子。VDSM为视频中物体或人物的身份以及所执行的动作学习分离的解耦表示。我们在一系列定性与定量任务上评估VDSM,包括身份与动态迁移、序列生成、Fréchet Inception Distance和因子分类。VDSM提供了最先进的性能,甚至超过了使用额外监督的对抗方法。

关键词

引用

@article{arxiv.2103.07292,
  title  = {VDSM: Unsupervised Video Disentanglement with State-Space Modeling and Deep Mixtures of Experts},
  author = {Matthew J. Vowels and Necati Cihan Camgoz and Richard Bowden},
  journal= {arXiv preprint arXiv:2103.07292},
  year   = {2021}
}