中文

MM-R1:解锁统一多模态大语言模型进行个性化图像生成的潜能

计算机视觉与模式识别 2025-08-27 v2

摘要

拥有统一架构的多模态大语言模型(MLLM)在广泛的 vision-language 任务中表现出色,但与个性化图像生成的对齐仍是重大挑战。现有 MLLM 方法往往针对特定主体,为每个新主体都需要数据密集型微调,限制了其可扩展性。本文提出 MM-R1 框架,通过引入跨模态 Chain-of-Thought(X-CoT)推理策略,解锁统一 MLLM 进行个性化图像生成的内在潜能。具体而言,我们将个性化建模为集成的视觉推理与生成过程:(1)通过解释和理解用户提供的图像及上下文线索来实现 subject concepts 的 grounding;(2)condition于提取的 subject 表示与用户提示,生成个性化图像。为进一步提升推理能力,我们采用 Grouped Reward Proximal Policy Optimization(GRPO)显式对齐生成过程。实验表明,MM-R1 以 zero-shot 方式释放了统一 MLLM 的个性化能力,能够生成高 subject fidelity 且 text alignment 强的图像。

关键词

引用

@article{arxiv.2508.11433,
  title  = {MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation},
  author = {Qian Liang and Yujia Wu and Kuncheng Li and Jiwei Wei and Shiyuan He and Jinyu Guo and Ning Xie},
  journal= {arXiv preprint arXiv:2508.11433},
  year   = {2025}
}