中文

用于少样本视频到视频转换的自适应紧凑注意力

计算机视觉与模式识别 2020-12-01 v1

摘要

本文提出一种用于少样本视频到视频转换的自适应紧凑注意力模型。该领域现有工作仅使用来自像素级注意力的特征,而未考虑多个参考图像间的相关性,导致计算量大而性能有限。因此,我们引入一种新颖的自适应紧凑注意力机制,以高效地从多个参考图像中联合提取上下文特征,其中编码的视角依赖与运动依赖信息可显著裨益于逼真视频的合成。我们的核心思想是从所有参考图像中提取紧凑基集作为更高层表示。为进一步提升可靠性,在推理阶段,我们还提出一种基于 Delaunay 三角剖分算法的新方法,根据输入标签自动选择信息丰富的参考图像。我们在大规模说话头部视频数据集与人跳舞数据集上广泛评估了我们的方法;实验结果表明,我们的方法在生成照片真实且时间一致的视频方面性能优越,并相较最先进方法取得可观提升。

关键词

引用

@article{arxiv.2011.14695,
  title  = {Adaptive Compact Attention For Few-shot Video-to-video Translation},
  author = {Risheng Huang and Li Shen and Xuan Wang and Cheng Lin and Hao-Zhi Huang},
  journal= {arXiv preprint arXiv:2011.14695},
  year   = {2020}
}

备注

Video available: https://youtu.be/1OCFbUrypKQ