CCVS:上下文感知的可控视频合成
计算机视觉与模式识别
2021-10-27 v2
摘要
本陈述介绍了一种自监督学习方法,用于从旧视频片段合成新视频片段,并引入了若干用于提升空间分辨率与真实感的新关键要素:它将合成过程以上下文信息为条件以保证时间连续性,并以辅助信息为条件以实现精细控制。该预测模型是双重自回归的:在自编码器的潜空间中进行预测,并在图像空间中更新上下文信息,后者也通过一个可学习的光流模块来强制时空一致性。在外观域与时间域上对自编码器进行对抗训练,以进一步提升其输出的真实感。在负责潜空间未来帧预测的编码器与 transformer 之间插入一个量化器(及其逆模块插入在 transformer 与解码器之间),通过提供简单机制来处理多模态辅助信息以控制合成过程(例如若干样本帧、音轨、图像空间中的轨迹),并允许多种预测以考虑未来的内在不确定性,从而增添了更大的灵活性。基于所提方法实现的实验在多项任务与标准基准上给出了非常好的定性与定量结果。
引用
@article{arxiv.2107.08037,
title = {CCVS: Context-aware Controllable Video Synthesis},
author = {Guillaume Le Moing and Jean Ponce and Cordelia Schmid},
journal= {arXiv preprint arXiv:2107.08037},
year = {2021}
}
备注
Accepted to NeurIPS 2021