通过再生进行精炼:扩大修改空间提升统一多模态模型中的图像精炼效果
计算机视觉与模式识别
2026-04-29 v1
摘要
统一多模态模型(UMMs)在单一框架内集成了视觉理解与生成。对于文本到图像(T2I)任务,这种统一能力允许 UMMs 在初始生成后对输出进行精炼,从而有望提升性能上限。当前基于 UMM 的精炼方法主要遵循“通过编辑进行精炼”范式,即 UMMs 生成编辑指令以修改未对齐区域,同时保留已对齐的内容。然而,编辑指令通常仅粗略描述提示词与图像的错配,导致精炼不完整。此外,像素级保留虽为编辑所必需,却不必要地限制了精炼的有效修改空间。为解决这些局限性,我们提出了“通过再生进行精炼”,这是一种将精炼重新表述为条件图像再生而非编辑的新颖框架。RvR 不依赖编辑指令且不强制严格保留内容,而是以目标提示词和初始图像的语义 token 为条件重新生成图像,从而在更大的修改空间中实现更完整的语义对齐。大量实验证明了 RvR 的有效性,将 Geneval 从 0.78 提升至 0.91,DPGBench 从 84.02 提升至 87.21,UniGenBench++ 从 61.53 提升至 77.41。
引用
@article{arxiv.2604.25636,
title = {Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models},
author = {Jiayi Guo and Linqing Wang and Jiangshan Wang and Yang Yue and Zeyu Liu and Zhiyuan Zhao and Qinglin Lu and Gao Huang and Chunyu Wang},
journal= {arXiv preprint arXiv:2604.25636},
year = {2026}
}
备注
GitHub: https://github.com/LeapLabTHU/RvR