UniGen:增强训练与测试时策略的统一多模态理解与生成
计算机视觉与模式识别
2025-05-21 v1
摘要
我们提出 UniGen,一个能够进行图像理解和生成的统一多模态大语言模型(MLLM)。我们从数据中心的角度研究了 UniGen 的完整训练管线,包括多阶段预训练、监督式微调和直接偏好优化。更重要的是,我们提出了一种新的测试时链式思维验证(Chain-of-Thought Verification,CoT-V)策略,通过简洁的 Best-of-N 测试时策略显著提升 UniGen 的图像生成质量。具体而言,CoT-V 使 UniGen 能够在测试时同时作为图像生成器和验证器,以逐步的方式评估文本提示与其生成图像之间的语义对齐。我们在完全基于开源数据集的各阶段训练,使 UniGen 在多项图像理解和生成基准测试中实现了最先进的性能,最终得分为 0.78(GenEval)和 85.19(DPG-Bench)。通过大量消融实验,我们的工作为构建统一 MLLM 的完整生命周期提供了可操作的见解,并解决了关键挑战,为未来研究的方向作出了有意义的贡献。
引用
@article{arxiv.2505.14682,
title = {UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation},
author = {Rui Tian and Mingfei Gao and Mingze Xu and Jiaming Hu and Jiasen Lu and Zuxuan Wu and Yinfei Yang and Afshin Dehghan},
journal= {arXiv preprint arXiv:2505.14682},
year = {2025}
}
备注
Technical report