Uni-X:通过两端分离架构缓解多模态冲突的统一多模态模型
计算机视觉与模式识别
2026-03-03 v3 人工智能
摘要
基于共享自回归(AR)变换器的统一多模态模型(UMM)因其架构简洁而备受关注。然而,我们发现了一个关键局限:在多模态输入上训练时,模态共享变换器在浅层和深层中遭受视觉与文本之间的严重梯度冲突。我们将这一问题追溯到图像和文本在底层统计特性上的根本差异,同时注意到在中间层表示变得更加抽象和语义对齐时冲突会减弱。为克服这一挑战,我们提出了 Uni-X,一种两端分离、中间共享的架构。Uni-X 将其初始层和最终层专门用于模态特定处理,同时在中间层保持共享参数以实现高层语义融合。这种 X 形设计不仅消除了两端的梯度冲突,还进一步缓解了共享层中的残余冲突。大量实验验证了 Uni-X 的有效性。在相同训练条件下,Uni-X 相比强基线实现了更优的训练效率。当扩展到 3B 参数和更大训练数据时,Uni-X 匹配或超越了 7B AR-based UMM,在图像生成方面取得了 GenEval 分数 82,同时在文本和视觉理解任务上表现强劲。这些结果确立了 Uni-X 作为未来统一多模态建模的参数高效且可扩展的基础。我们的代码可在 https://github.com/CURRENTF/Uni-X 获取。
引用
@article{arxiv.2509.24365,
title = {Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models},
author = {Jitai Hao and Hao Liu and Xinyan Xiao and Qiang Huang and Jun Yu},
journal= {arXiv preprint arXiv:2509.24365},
year = {2026}
}
备注
ICLR 2026