面向统一多模态交错生成:基于组相对策略优化
计算机视觉与模式识别
2026-03-11 v1
摘要
统一视觉语言模型在多模态理解与生成方面取得了显著进展,但在生成多模态交错输出方面仍有不足,这是视觉叙事和逐步视觉推理等任务中关键能力。本文提出一种基于强化学习的后训练策略,以无需依赖大规模多模态交错数据集的方式,赋予现有统一模型此能力。我们首先进行预热阶段,采用混合数据集,包含精选的交错序列以及有限的多模态理解和文本到图像生成数据,使模型在保持预训练能力的同时暴露于交错生成模式。为进一步优化交错生成,我们提出一种统一的策略优化框架,将组相对策略优化(GRPO)扩展至多模态设置。我们的 метод法在单个解码轨迹中联合建模文本与图像生成,并通过涵盖文本相关性、视觉文本对齐和结构忠实性的新颖混合奖励进行优化。此外,我们引入过程级奖励以提供逐步指导,提高复杂多模态任务中的训练效率。在 MMIE 和 InterleavedBench 上的实验表明,我们的方法显著提升了多模态交错生成的质量与连贯性。
引用
@article{arxiv.2603.09538,
title = {Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization},
author = {Ming Nie and Chunwei Wang and Jianhua Han and Hang Xu and Li Zhang},
journal= {arXiv preprint arXiv:2603.09538},
year = {2026}
}