中文

用于无监督图像动画的运动Transformer

计算机视觉与模式识别 2022-09-29 v1

摘要

图像动画旨在利用从驱动视频中学到的运动对源图像进行动画化。当前最先进的方法通常使用卷积神经网络(CNN)预测运动信息,如运动关键点及相应的局部变换。然而,这些基于CNN的方法未显式建模运动间的交互;因此,重要的潜在运动关系可能被忽略,从而可能在生成的动画视频中产生明显伪影。为此,我们提出一种新方法——运动Transformer,其首次尝试基于视觉Transformer构建运动估计器。更具体地,我们在所提方法中引入两类令牌:i)由图像块特征及相应位置编码构成的图像令牌;ii)编码了运动信息的运动令牌。两类令牌均送入视觉Transformer,通过多头自注意力块促进它们之间的潜在交互。采用该过程,运动信息可被更好地学习以提升模型性能。最终嵌入的运动令牌被用于预测相应的运动关键点与局部变换。在基准数据集上的大量实验表明,我们所提方法相较最先进基线取得了有前景的结果。我们的源代码将公开可用。

关键词

引用

@article{arxiv.2209.14024,
  title  = {Motion Transformer for Unsupervised Image Animation},
  author = {Jiale Tao and Biao Wang and Tiezheng Ge and Yuning Jiang and Wen Li and Lixin Duan},
  journal= {arXiv preprint arXiv:2209.14024},
  year   = {2022}
}