中文

基于增强多尺度交叉注意力的人员图像生成

计算机视觉与模式识别 2025-01-16 v1

摘要

本文提出一种新颖的基于交叉注意力的生成对抗网络(GAN),用于解决具有挑战性的人员图像生成任务。交叉注意力是一种直观的多模态融合方法,通过计算两种不同模态特征图之间的注意力/相关矩阵。具体而言,我们提出了一种新型的 XingGAN(或 CrossingGAN),其包含两个生成分支,分别捕获人员的外观和形状。此外,我们提出了两种新的交叉注意力模块,以有效地传递和更新人员的形状和外观嵌入,以实现相互改进。这一点尚未被任何现有的基于GAN的图像生成工作所考虑。为进一步学习不同人员姿态在不同尺度和子区域之间的长程相关性,我们提出了两种新的多尺度交叉注意力模块。为解决交叉注意力机制中独立相关计算导致注意力权重噪声和模糊的问题,从而影响性能提升,我们提出了一种称为增强注意力(EA)的模块。最后,我们引入一种新颖的密集连接共注意力模块,以有效地在不同阶段融合外观和形状特征。在两个公开数据集上的大量实验表明,我们的方法优于当前基于GAN的方法,在与扩散模型相当的性能下,速度显著快于扩散模型,包括训练和推理过程。

关键词

引用

@article{arxiv.2501.08900,
  title  = {Enhanced Multi-Scale Cross-Attention for Person Image Generation},
  author = {Hao Tang and Ling Shao and Nicu Sebe and Luc Van Gool},
  journal= {arXiv preprint arXiv:2501.08900},
  year   = {2025}
}

备注

Accepted to TPAMI, an extended version of a paper published in ECCV2020. arXiv admin note: substantial text overlap with arXiv:2007.09278