HermesFlow:无缝弥合多模态理解与生成之间的差距
计算机视觉与模式识别
2025-09-26 v2
摘要
自回归范式的显著成功使多模态大型语言模型(MLLMs)取得了重大进展,Show-o、Transfusion 和 Emu3 等强大模型在统一图像理解与生成方面取得了显著进展。我们首次揭示了一个普遍现象:MLLMs 的理解能力通常强于其生成能力,两者之间存在显著差距。基于这一洞察,我们提出了 HermesFlow,一个简单而通用的框架,旨在无缝弥合 MLLMs 中理解与生成之间的差距。具体而言,我们以同源数据为输入来策划理解与生成的同源偏好数据。通过 Pair-DPO 和自对弈迭代优化,HermesFlow 利用同源偏好数据有效对齐多模态理解与生成。大量实验证明了我们的方法在缩小多模态理解与生成差距方面的显著优越性。这些发现凸显了 HermesFlow 作为下一代多模态基础模型通用对齐框架的潜力。代码:https://github.com/Gen-Verse/HermesFlow
引用
@article{arxiv.2502.12148,
title = {HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation},
author = {Ling Yang and Xinchen Zhang and Ye Tian and Chenming Shang and Minghao Xu and Wentao Zhang and Bin Cui},
journal= {arXiv preprint arXiv:2502.12148},
year = {2025}
}
备注
NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow