UniFork:探索多模态理解与生成的模态对齐
计算机视觉与模式识别
2025-06-23 v1
摘要
统一的图像理解与生成已成为多模态人工智能的热门范式。尽管近期取得了进展,但对于此类统一模型的最优架构设计仍是开放挑战。本文首先分析了面向理解与生成的任务特定专家模型以及当前统一模型的模态对齐行为。我们的分析揭示了一个关键观察:理解任务受益于跨网络深度的逐渐增大的模态对齐,这有助于构建更佳理解的语义信息;相反,生成任务遵循不同趋势:模态对齐在浅层增加,但在深层层次下降,以恢复空间细节。这种不同程度的对齐模式在完全共享的Transformer 主干网络中造成根本性冲突,因而统一的表示流往往导致跨两项任务的性能妥协。基于此发现,我们引入UniFork,一种新型Y 形架构,共享浅层以实现跨任务表示学习,同时在更深的层次中采用任务特定分支以避免任务干扰。该设计有效平衡了共享学习与任务专化。通过大量消融实验,我们证明UniFork consistently优于传统完全共享Transformer 架构,性能与或优于任务特定模型。
引用
@article{arxiv.2506.17202,
title = {UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation},
author = {Teng Li and Quanfeng Lu and Lirui Zhao and Hao Li and Xizhou Zhu and Yu Qiao and Jun Zhang and Wenqi Shao},
journal= {arXiv preprint arXiv:2506.17202},
year = {2025}
}
备注
Code: https://github.com/tliby/UniFork