中文

学习注意力中的流场以实现可控人物图像生成

计算机视觉与模式识别 2024-12-13 v2

摘要

可控人物图像生成旨在根据参考图像生成人物图像,从而实现对人物外观或姿态的精确控制。然而,先前的方法尽管实现了高整体图像质量,但往往扭曲参考图像中的细粒度纹理细节。我们将这些失真归因于对参考图像中相应区域的注意力不足。为此,我们提出学习注意力中的流场(Leffa),在训练过程中显式引导目标查询在注意力层中关注正确的参考键。具体而言,它通过在基于扩散的基线之上的注意力图上施加正则化损失来实现。我们的大量实验表明,Leffa 在控制外观(虚拟试穿)和姿态(姿态迁移)方面达到了最先进的性能,在保持高图像质量的同时显著减少了细粒度细节失真。此外,我们证明我们的损失是模型无关的,可以用于提升其他扩散模型的性能。

关键词

引用

@article{arxiv.2412.08486,
  title  = {Learning Flow Fields in Attention for Controllable Person Image Generation},
  author = {Zijian Zhou and Shikun Liu and Xiao Han and Haozhe Liu and Kam Woh Ng and Tian Xie and Yuren Cong and Hang Li and Mengmeng Xu and Juan-Manuel Pérez-Rúa and Aditya Patel and Tao Xiang and Miaojing Shi and Sen He},
  journal= {arXiv preprint arXiv:2412.08486},
  year   = {2024}
}

备注

github: https://github.com/franciszzj/Leffa, demo: https://huggingface.co/spaces/franciszzj/Leffa, model: https://huggingface.co/franciszzj/Leffa