利用变长注意力头的高效图像生成
计算机视觉与模式识别
2025-06-27 v3 人工智能
机器学习
摘要
尽管将transformer集成到视觉模型中已在视觉任务上取得显著改进,但它们在训练和推理中仍需要大量计算。受限注意力机制大幅降低了这些计算负担,但代价是丧失全局或局部一致性。我们提出一种简单而强大的方法来减少这些权衡:允许单个transformer的注意力头关注多个感受野。我们基于邻域注意力(NA)演示了该方法,并将其集成到基于StyleGAN的架构中以进行图像生成。通过这项被称为StyleNAT的工作,我们能够在FFHQ上达到2.05的FID,较StyleGAN-XL提升6%,同时参数量减少28%且吞吐量能力提升4。StyleNAT在FFHQ-256上达到了帕累托前沿,并在其他数据集上展示了强大且高效的图像生成能力。我们的代码和模型检查点公开于:https://github.com/SHI-Labs/StyleNAT
引用
@article{arxiv.2211.05770,
title = {Efficient Image Generation with Variadic Attention Heads},
author = {Steven Walton and Ali Hassani and Xingqian Xu and Zhangyang Wang and Humphrey Shi},
journal= {arXiv preprint arXiv:2211.05770},
year = {2025}
}
备注
Published in eLVM @ CVPR (https://openaccess.thecvf.com/content/CVPR2025W/eLVM/html/Walton_Efficient_Image_Generation_with_Variadic_Attention_Heads_CVPRW_2025_paper) | Formerly named StyleNAT: Giving Each Head a New Perspective |