中文

FiT:面向扩散模型的灵活视觉Transformer

计算机视觉与模式识别 2024-10-16 v4

摘要

自然界无限分辨率自由。在此背景下,现有的扩散模型,如扩散Transformer,常常面临处理训练领域之外图像分辨率的挑战。为克服这一限制,我们提出了灵活视觉Transformer(FiT),这是一种专为生成无限制分辨率和宽高比的图像而设计的Transformer架构。不同于传统方法将图像视为固定分辨率网格,FiT将图像概念化为动态大小token的序列。这种视角使我们能够轻松地在训练和推理阶段适应多样化的宽高比,从而促进分辨率泛化,消除图像裁剪引起的偏差。经过精心调整的网络结构和集成训练-free外推技术的增强,FiT在分辨率外推生成方面展现出惊人的灵活性。全面实验表明,FiT在广泛范围内的分辨率上表现出色,既在其训练分辨率分布内,也在其训练分辨率分布之外,均显示出卓越的效果。仓库地址为 https://github.com/whlzy/FiT。

关键词

引用

@article{arxiv.2402.12376,
  title  = {FiT: Flexible Vision Transformer for Diffusion Model},
  author = {Zeyu Lu and Zidong Wang and Di Huang and Chengyue Wu and Xihui Liu and Wanli Ouyang and Lei Bai},
  journal= {arXiv preprint arXiv:2402.12376},
  year   = {2024}
}