AIA:重构统一多模态模型的架构解耦策略
计算机视觉与模式识别
2026-05-13 v5
摘要
统一的多模态模型用于图像生成和理解代表了通往 AGI 的重要一步,吸引了众多研究者的关注。该任务的主要挑战在于,由于理解和生成任务中固有的目标冲突,难以建立最佳训练范式。为缓解这些冲突并追求更高性能,许多研究者采用不同程度的架构解耦(例如双图像编码器、MOE/MOT 架构或冻结 MLLM)。然而,过度的模型解耦会导致交错生成能力的丢失,削弱了统一模型的原初意图。本文旨在探索如何在不采用模型解耦的情况下减轻任务冲突。首先,我们分析了为何通过解耦能够提升性能,通过研究模型的跨模态注意力行为。我们观察到,架构解耦并不能解决任务冲突,而本质上是将模型引导 toward 任务特定模型的跨模态交互模式,如 Qwen3-VL 和 HunyuanImage-3.0,解耦程度越深,行为越一致。鼓励这一观察,我们提出注意力交互对齐 (AIA) loss,该方法在训练期间显式学习任务特定的多模态交互模式。为演示 AIA loss 的通用性,我们分别在 Emu3 和 Janus-Pro 上进行 SFT 和后训练阶段的应用。没有任何花哨的技巧,AIA 不仅细化了跨模态注意力模式,还提升了生成和理解性能。
引用
@article{arxiv.2511.22663,
title = {AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model},
author = {Dian Zheng and Manyuan Zhang and Hongyu Li and Kai Zou and Hongbo Liu and Ziyu Guo and Kaituo Feng and Yexin Liu and Ying Luo and Hongsheng Li},
journal= {arXiv preprint arXiv:2511.22663},
year = {2026}
}
备注
Project page: https://zhengdian1.github.io/AIA-project/ Code: https://github.com/zhengdian1/AIA