S3VAE:用于表征解耦与数据生成的自监督序列变分自编码器
计算机视觉与模式识别
2020-05-26 v1
摘要
我们提出了一种序列变分自编码器,在自监督下学习序列数据(如视频和音频)的解耦表征。具体而言,我们利用输入数据本身或某些现成功能模型中易于获取的监督信号的优势,并据此为模型设计辅助任务以利用这些信号。在这些信号的监督下,我们的模型可以轻松地将输入序列的表征解耦为静态因子和动态因子(即时不变部分和时变部分)。跨视频和音频的综合实验验证了我们的模型在序列数据表征解耦与生成方面的有效性,并证明我们的自监督模型性能与使用真实标签的全监督模型相当甚至更优,且大幅优于最先进的无监督模型。
引用
@article{arxiv.2005.11437,
title = {S3VAE: Self-Supervised Sequential VAE for Representation Disentanglement and Data Generation},
author = {Yizhe Zhu and Martin Renqiang Min and Asim Kadav and Hans Peter Graf},
journal= {arXiv preprint arXiv:2005.11437},
year = {2020}
}
备注
to appear in CVPR2020