中文

LightFusion:面向统一多模态理解与生成的轻量级双融合框架

计算机视觉与模式识别 2025-11-21 v4

摘要

统一多模态模型最近在能力和通用性方面取得了显著进展,但大多数领先系统仍需从头训练且需要大量计算资源。本文表明,通过战略性地融合专为生成或理解设计的公开模型,可获得相当的性能。我们的关键设计是在保留原始模块的基础上,进一步在网络中交错插入多模态自注意力模块。这种双融合机制(1)有效地实现了丰富的多模态融合,同时基本保留了基础模型的原有优势;(2)催化了来自理解编码器的高层次语义表征与来自生成编码器的低层次空间信号之间的协同融合。通过仅使用约 350 亿 token 的训练,本方法在多个基准测试上取得强劲结果:GenEval 上为 0.91,DPG-Bench 上为 82.16,GEditBench 上为 6.06,ImgEdit-Bench 上为 3.77。通过充分发布整个代码、模型权重和数据集,我们希望支持未来在统一多模态建模方面的研究。

关键词

引用

@article{arxiv.2510.22946,
  title  = {LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation},
  author = {Zeyu Wang and Zilong Chen and Chenhui Gou and Feng Li and Chaorui Deng and Deyao Zhu and Kunchang Li and Weihao Yu and Haoqin Tu and Haoqi Fan and Cihang Xie},
  journal= {arXiv preprint arXiv:2510.22946},
  year   = {2025}
}

备注

Preprint. Work in progress