从视频中无监督学习解耦表征
机器学习
2024-03-15 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
我们提出了一种新模型 DrNET,它从视频中学习解耦的图像表征。我们的方法利用视频的时间连贯性和一种新颖的对抗性损失,来学习一种将每一帧分解为静态部分和时变成分的表征。这种解耦表征可用于一系列任务。例如,将标准 LSTM 应用于时变成分可以实现对未来帧的预测。我们在一系列合成和真实视频上评估了我们的方法,展示了连贯生成数百步未来帧的能力。
引用
@article{arxiv.1705.10915,
title = {Unsupervised Learning of Disentangled Representations from Video},
author = {Remi Denton and Vighnesh Birodkar},
journal= {arXiv preprint arXiv:1705.10915},
year = {2024}
}