基于动作图的组合式视频合成
计算机视觉与模式识别
2021-06-14 v4 机器学习
摘要
动作视频是包含丰富时空组合结构的复杂信号。当前视频生成方法缺乏对生成过程施加基于多个协调且可能同时发生的定时动作的条件的能力。为应对此挑战,我们提出以称为动作图(Action Graph)的图结构来表示动作,并给出新的“动作图到视频”(Action Graph To Video)合成任务。我们针对该任务的生成模型(AG2Vid)解耦了运动与外观特征,并通过引入动作调度机制实现了及时且协调的视频生成。我们在CATER与Something-Something V2数据集上训练并评估AG2Vid,结果表明相较基线,所得视频具有更好的视觉质量与语义一致性。最后,我们的模型通过合成所学动作的新组合展现了零样本能力。有关代码与预训练模型,见项目页面 https://roeiherz.github.io/AG2Video
引用
@article{arxiv.2006.15327,
title = {Compositional Video Synthesis with Action Graphs},
author = {Amir Bar and Roei Herzig and Xiaolong Wang and Anna Rohrbach and Gal Chechik and Trevor Darrell and Amir Globerson},
journal= {arXiv preprint arXiv:2006.15327},
year = {2021}
}
备注
ICML 2021 Camera Ready