MM-R1:解锁统一多模态大语言模型进行个性化图像生成的潜能
计算机视觉与模式识别
2025-08-27 v2
摘要
拥有统一架构的多模态大语言模型(MLLM)在广泛的 vision-language 任务中表现出色,但与个性化图像生成的对齐仍是重大挑战。现有 MLLM 方法往往针对特定主体,为每个新主体都需要数据密集型微调,限制了其可扩展性。本文提出 MM-R1 框架,通过引入跨模态 Chain-of-Thought(X-CoT)推理策略,解锁统一 MLLM 进行个性化图像生成的内在潜能。具体而言,我们将个性化建模为集成的视觉推理与生成过程:(1)通过解释和理解用户提供的图像及上下文线索来实现 subject concepts 的 grounding;(2)condition于提取的 subject 表示与用户提示,生成个性化图像。为进一步提升推理能力,我们采用 Grouped Reward Proximal Policy Optimization(GRPO)显式对齐生成过程。实验表明,MM-R1 以 zero-shot 方式释放了统一 MLLM 的个性化能力,能够生成高 subject fidelity 且 text alignment 强的图像。
引用
@article{arxiv.2508.11433,
title = {MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation},
author = {Qian Liang and Yujia Wu and Kuncheng Li and Jiwei Wei and Shiyuan He and Jinyu Guo and Ning Xie},
journal= {arXiv preprint arXiv:2508.11433},
year = {2025}
}