Open-MAGVIT2:面向 democratizing 自动回归视觉生成的开源项目
计算机视觉与模式识别
2025-02-11 v3 人工智能
摘要
Open-MAGVIT2 项目实现了对 Google MAGVIT-v2 标记器的开源复现,该标记器拥有超大码本(即 个代码),在 ImageNet 和 UCF 基准测试上实现了最先进的重建性能。我们还提供了在大规模数据上预训练的标记器,在零样例基准测试中显著优于 Cosmos(在 ImageNet 原始分辨率上 rFID 为 1.93 vs. 0.78)。此外,我们探索了其在普通自动回归模型中的应用,以验证其可扩展性,构建了规模从 300M 到 1.5B 的自动回归图像生成模型族。为帮助自动回归模型处理超大词汇表,我们通过非对称 token 分解将其分为两个不同大小的子词汇表,并进一步引入“next sub-token prediction”以增强子 token 之间的相互作用,以获得更好的生成质量。我们发布所有模型和代码,以促进自动回归视觉生成领域的创新与创造力。
引用
@article{arxiv.2409.04410,
title = {Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation},
author = {Zhuoyan Luo and Fengyuan Shi and Yixiao Ge and Yujiu Yang and Limin Wang and Ying Shan},
journal= {arXiv preprint arXiv:2409.04410},
year = {2025}
}