HBridge:面向统一多模态理解与生成的异构专家 H 形桥接
计算机视觉与模式识别
2025-11-26 v1
摘要
最近的统一模型将理解专家(如 LLM)与生成专家(如扩散模型)集成,实现了强大的多模态性能。然而,近期诸如 BAGEL 和 LMFusion 等先进方法遵循 Mixture-of-Transformers(MoT)范式,采用对称设计,镜像对待各专家以便于初始化和融合,由于内在的模态差异,仍显得次优。本文提出 HBridge,一种非对称的 H 形架构,使异构专家能够充分利用其所属模态领域的预训练先验。不同于先前通过共享注意力直接连接专家所有层的稠密融合策略,HBridge 有选择地桥接中间层,减少超过 40% 的注意力共享,从而提升效率并增强生成质量。浅层和深层层捕获模态特定表征的特征被解耦,中层桥接促进语义对齐。为进一步强化跨模态连贯性,我们引入语义重建标记,显式引导生成专家重建目标图像的视觉语义标记。广泛的实验表明,HBridge 在多个基准测试上的有效性和优异性能,确立了统一多模态生成的新范式。
引用
@article{arxiv.2511.20520,
title = {HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation},
author = {Xiang Wang and Zhifei Zhang and He Zhang and Zhe Lin and Yuqian Zhou and Qing Liu and Shiwei Zhang and Yijun Li and Shaoteng Liu and Haitian Zheng and Jason Kuen and Yuehuan Wang and Changxin Gao and Nong Sang},
journal= {arXiv preprint arXiv:2511.20520},
year = {2025}
}