中文

FloAt:基于自注意力流变换的服装动画生成

计算机视觉与模式识别 2024-11-25 v1

摘要

我们提出了基于扩散模型的方法 FloAtControlNet,用于生成由人类服装动画组成的电影画面。我们关注人类服装,如连衣裙、裙子和裤子。本模型的输入是描绘服装类型及其纹理(如豹纹、条纹或 plain)的文本提示,以及捕获我们期望输出中动画的正常图序列。我们方法的主干是基于正常图条件的 ControlNet,其以训练自由的方式运行。我们的关键观察是,所需的底层动画嵌入在正常图的流中。我们利用获得的流来操作特定层的自注意力图。具体而言,特定层和帧的自注意力图被重新计算为其自身与该层和前一帧的自注意力图的线性组合,这些自注意力图依据正常图中两帧的流进行扭曲。我们表明,操控自注意力图显著提升了服装动画质量,使其看起来更自然,同时抑制了背景伪影。通过大量实验,我们展示了所提出的方法在视觉结果和用户研究方面均优于所有基线方法。具体而言,我们的方法能够缓解其他基于扩散模型的基线方法中存在的背景闪烁问题。此外,我们表明我们的方法在基于输入正常图序列与来自输出 RGB 帧的正常图序列计算的 RMSE 和 PSNR 指标中均优于所有基线方法。进一步地,我们表明,像 LPIPS、SSIM 和 CLIP 等旨用于视觉质量评估的成熟指标并不一定适用于捕捉人类服装动画中细微运动。

关键词

引用

@article{arxiv.2411.15028,
  title  = {FloAt: Flow Warping of Self-Attention for Clothing Animation Generation},
  author = {Swasti Shreya Mishra and Kuldeep Kulkarni and Duygu Ceylan and Balaji Vasan Srinivasan},
  journal= {arXiv preprint arXiv:2411.15028},
  year   = {2024}
}