中文

OmniBridge:基于潜在空间对齐的统一多模态理解、生成与检索

机器学习 2025-09-24 v1

摘要

多模态大语言模型 (LLMs) 的最新进展在理解、生成和检索任务中取得了显著进展。然而,当前的解决方案通常孤立地处理这些任务,或需要从头训练 LLMs,导致计算成本高昂且跨模态泛化能力有限。在这项工作中,我们提出了 OmniBridge,这是一个统一且模块化的多模态框架,可在统一架构内支持视觉-语言理解、生成和检索。OmniBridge 采用了以语言为中心的设计,复用预训练的 LLMs,并引入了一个轻量级的双向潜在对齐模块。为了应对任务干扰的挑战,我们提出了一种两阶段解耦训练策略:监督微调和潜在空间对齐,用于将 LLM 行为与多模态推理对齐;以及语义引导扩散训练,通过可学习的查询嵌入来对齐跨模态潜在空间。在广泛的基准测试上的大量实验表明,OmniBridge 在所有三项任务中均取得了具有竞争力或最先进的性能。此外,我们的结果突出了潜在空间对齐在共享表示空间下统一多模态建模的有效性。代码和模型已发布于 https://github.com/xiao-xt/OmniBridge。

关键词

引用

@article{arxiv.2509.19018,
  title  = {OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment},
  author = {Teng Xiao and Zuchao Li and Lefei Zhang},
  journal= {arXiv preprint arXiv:2509.19018},
  year   = {2025}
}