跨视角 exogenous 到 egocentric 视频合成
计算机视觉与模式识别
2021-07-08 v1 多媒体
摘要
跨视角视频合成任务旨在从一个视角生成另一个截然不同视角的视频序列。本文研究 exogenous(第三人称)视角到 egocentric(第一人称)视角的视频生成任务。这具有挑战性,因为 egocentric 视角有时与 exocentric 视角显著不同。因此,跨两个不同视角转换外观并非易事。特别地,我们提出了一种新颖的双向时空注意力融合生成对抗网络(STA-GAN),以学习空间与时间信息,从 exocentric 视角生成 egocentric 视频序列。所提出的 STA-GAN 由三部分组成:时间分支、空间分支和注意力融合。首先,时间与空间分支生成一系列伪帧及其对应特征。伪帧在时间分支与空间分支均按下游与上游两个方向生成。接下来,生成的四种不同伪帧及其对应特征(两个方向的时空分支)被输入到一种新颖的多生成注意力融合模块中以产生最终视频序列。同时,我们还提出了一种新颖的时空双判别器以实现更鲁棒的网络优化。在 Side2Ego 与 Top2Ego 数据集上的大量实验表明,所提出的 STA-GAN 显著优于现有方法。
引用
@article{arxiv.2107.03120,
title = {Cross-View Exocentric to Egocentric Video Synthesis},
author = {Gaowen Liu and Hao Tang and Hugo Latapie and Jason Corso and Yan Yan},
journal= {arXiv preprint arXiv:2107.03120},
year = {2021}
}
备注
ACM MM 2021