ParaUni:基于强化学习驱动的分层并行信息交互增强统一多模态模型生成
计算机视觉与模式识别
2026-03-31 v2
摘要
统一多模态模型显著提高视觉生成效果,通过结合视觉语言模型(VLM)和扩散模型实现。然而,现有方法难以在充分的交互与灵活实现之间取得平衡,由于表示差异巨大。考虑到VLM各层从低级细节到高级语义的丰富且分层信息,我们提出了\textbf{ParaUni}。它以\textbf{Para}allel方式从变体VLM的各层提取特征,以实现全面信息交互,同时保持灵活的分离架构,以增强\textbf{Uni}ified多模态模型的生成效果。具体而言,来自VLM所有层的视觉特征并行输入到层集成模块(LIM),该模块高效整合细粒度细节与语义抽象,并提供融合后的表示作为扩散模型的条件输入。为进一步提升性能,我们揭示了这些分层层在强化学习中对不同奖励的响应不均。关键地,我们设计了基于层的动态调整机制(LDAM),以对齐这些层的分层特性,实现多重奖励改进。大量实验表明,ParaUni利用互补的多层特征显著提升了生成质量,在RL阶段展现出强大的多奖励进步潜力。代码已公开于 https://github.com/JosephTiTan/ParaUni。
引用
@article{arxiv.2512.05422,
title = {ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction},
author = {Jiangtong Tan and Lin Liu and Jie Huanng and Xiaopeng Zhang and Qi Tian and Feng Zhao},
journal= {arXiv preprint arXiv:2512.05422},
year = {2026}
}