ENAT:重新思考基于 Token 的图像合成中的时空交互
计算机视觉与模式识别
2024-11-12 v1 人工智能
摘要
最近,基于 Token 的生成方法在图像合成中展示了其有效性。作为代表性例子,非自回归 Transformer(NATs)可以在几步内生成质量较好的图像。NATs 以渐进方式执行生成,其中结果图像的潜在 Token 被逐步揭示。在每一步中,未揭示的图像区域用掩码 Token 填充,并由 NAT 进行推理。在本文中,我们深入探讨了 NATs 有效性的内在机制,并揭示了 NATs 中自然涌现的两个重要模式:在空间维度(单步内),尽管掩码 Token 和可见 Token 被 NATs 均匀处理,但它们之间的交互是高度不对称的。具体而言,掩码 Token 主要为解码收集信息,而可见 Token 倾向于主要提供信息,其深度表示只能建立在自身之上。在时间维度(跨步骤),相邻生成步骤之间的交互主要集中在更新少量关键 Token 的表示,而大多数 Token 的计算通常是重复性的。受这些发现驱动,我们提出了 EfficientNAT(ENAT),一种明确鼓励 NATs 中这些关键交互的非自回归 Transformer。在空间层面,我们通过独立编码可见 Token 来解耦可见 Token 和掩码 Token 的计算,同时在完全编码的可见 Token 条件下解码掩码 Token。在时间层面,我们优先计算每一步的关键 Token,同时最大化复用先前计算的 Token 表示以补充必要信息。ENAT 在显著降低计算成本的同时明显提升了 NATs 的性能。在 ImageNet-256、ImageNet-512 和 MS-COCO 上的实验验证了 ENAT 的有效性。代码可在 https://github.com/LeapLabTHU/ENAT 获取。
引用
@article{arxiv.2411.06959,
title = {ENAT: Rethinking Spatial-temporal Interactions in Token-based Image Synthesis},
author = {Zanlin Ni and Yulin Wang and Renping Zhou and Yizeng Han and Jiayi Guo and Zhiyuan Liu and Yuan Yao and Gao Huang},
journal= {arXiv preprint arXiv:2411.06959},
year = {2024}
}
备注
Accepted by NeurIPS2024