X-Fusion:为冻结的大语言模型引入新模态
计算机视觉与模式识别
2025-04-30 v1
摘要
我们提出了 X-Fusion,一个能够在保持语言能力的前提下扩展预训练大语言模型(LLM)以适应多模态任务的框架。X-Fusion 采用双塔设计,具备模态特定权重,保持 LLM 参数冻结,同时集成视觉特定信息以实现理解与生成。我们的实验表明,X-Fusion 在图像到文本和文本到图像任务上始终优于替代架构。我们发现,融合以理解为导向的数据可提升生成质量,降低图像数据噪声可增强整体性能,而特征对齐对小模型加速收敛但对大模型影响有限。我们的发现为构建高效统一多模态模型提供了宝贵洞见。
引用
@article{arxiv.2504.20996,
title = {X-Fusion: Introducing New Modality to Frozen Large Language Models},
author = {Sicheng Mo and Thao Nguyen and Xun Huang and Siddharth Srinivasan Iyer and Yijun Li and Yuchen Liu and Abhishek Tandon and Eli Shechtman and Krishna Kumar Singh and Yong Jae Lee and Bolei Zhou and Yuheng Li},
journal= {arXiv preprint arXiv:2504.20996},
year = {2025}
}
备注
Project Page: https://sichengmo.github.io/XFusion/