Quantize-then-Rectify:高效 VQ-VAE 训练方法
计算机视觉与模式识别
2025-07-15 v1 机器学习
摘要
视觉标记器在多模态大模型中起着关键作用,充当连续输入与离散标记之间的桥梁。然而,训练高压缩率 VQ-VAE 仍然计算密集,常需数千个 GPU 小时。本工作展示,预训练的 VAE 可通过控制其容忍阈值内的量化噪声来高效转换为 VQ-VAE。我们提出了"Quantize-then-Rectify (ReVQ)"框架,利用预训练 VAE 实现最小计算开销的快速 VQ-VAE 训练。通过集成"通道多组量化"扩大词典容量,并采用"后整理器"缓解量化误差,ReVQ 将 ImageNet 图像压缩为最多 512 个标记,同时保持具竞争力的重构质量(rFID = 1.06)。显著地,ReVQ 将训练成本降低了两个数量级:ReVQ 在单张 NVIDIA 4090 上约 22 小时完成完整训练,而具有竞争力的方法需要在 32 张 A100 GPU 上 4.5 天。实验结果显示,ReVQ 在效率-重构权衡方面表现优异。
引用
@article{arxiv.2507.10547,
title = {Quantize-then-Rectify: Efficient VQ-VAE Training},
author = {Borui Zhang and Qihang Rao and Wenzhao Zheng and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2507.10547},
year = {2025}
}