Hyper-Bagel:面向多模态理解与生成的统一加速框架
计算机视觉与模式识别
2025-09-24 v1
摘要
统一多模态模型因其在联合理解和生成多样内容方面的卓越能力而近期备受关注。然而,随着上下文整合了越来越多交错的 multimodal tokens,扩散去噪和自回归解码的迭代过程带来了显著的计算开销。为解决此问题,我们提出了 Hyper-Bagel,一个旨在同时加速多模态理解与生成任务的统一加速框架。我们的方法采用分治策略,使用 speculative decoding 进行 next-token prediction,并使用多阶段蒸馏过程进行扩散去噪。该框架带来了显著的性能提升,在多模态理解中实现了超过 2 倍的加速。对于生成任务,我们最终得到的无损 6-NFE 模型在 text-to-image 生成中实现了 16.67 倍的加速,在图像编辑中实现了 22 倍的加速,同时保持了原始模型的高质量输出。我们进一步开发了一个高效的 1-NFE 模型,实现了近乎实时的交互式编辑与生成。通过将先进的对抗蒸馏与人类反馈学习相结合,该模型实现了极致的成本效益和响应速度,使复杂的多模态交互变得无缝且即时。
引用
@article{arxiv.2509.18824,
title = {Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation},
author = {Yanzuo Lu and Xin Xia and Manlin Zhang and Huafeng Kuang and Jianbin Zheng and Yuxi Ren and Xuefeng Xiao},
journal= {arXiv preprint arXiv:2509.18824},
year = {2025}
}
备注
Technical Report