基于 MLLM 控制的精准对象级编辑 POEM
计算机视觉与模式识别
2025-04-14 v1
摘要
扩散模型显著提升了文本到图像生成质量,能够从文本描述中生成高质量、逼真的图像。然而,对象级图像编辑仍是一个具有挑战性的问题,需要进行精确的修改,同时保持视觉连贯性。现有的基于文本的指令编辑方法在局部形状和布局转换方面难以精准控制,常会引入意外的全局变化。基于图像交互的方法虽然提供更好的精度,但需要人工提供精确的指导。为在减少手动工作量的同时保持高精度图像编辑,我们提出了 POEM—a 用于精准对象级编辑的框架,利用多模态大语言模型 (MLLM)。POEM 利用 MLLM 分析指令提示并生成转换前后精确的对象掩码,实现细粒度控制而无需大量用户输入。该结构化推理阶段指导基于扩散的编辑过程,确保对象定位和转换的准确性。为评估我们的ethods,我们引入了 VOCEdits—a 基于 PASCAL VOC 2012 构建的基准数据集,包含指令编辑提示、ground-truth 转换和精确对象掩码。实验结果表明,POEM 在精度和可靠性方面优于现有的基于文本的图像编辑方法,同时在减少手动工作量方面优于基于交互的方法。
引用
@article{arxiv.2504.08111,
title = {POEM: Precise Object-level Editing via MLLM control},
author = {Marco Schouten and Mehmet Onurcan Kaya and Serge Belongie and Dim P. Papadopoulos},
journal= {arXiv preprint arXiv:2504.08111},
year = {2025}
}
备注
Accepted to SCIA 2025