中文

通过多模态大语言模型引导基于指令的图像编辑

计算机视觉与模式识别 2024-02-06 v2

摘要

基于指令的图像编辑借助自然命令提升图像操控的可控性与灵活性,无需精细描述或区域掩码。然而,人类指令有时过于简略,当前方法难以捕捉与遵循。多模态大语言模型(MLLMs)展现出通过 LMs 进行跨模态理解与视觉感知响应生成的潜力。我们探究 MLLMs 如何助力编辑指令,并提出 MLLM 引导的图像编辑(MGIE)。MGIE 学习推导具表现力的指令并提供显式引导。编辑模型通过端到端训练联合捕获该视觉想象并执行操控。我们评估了 Photoshop 风格修改、全局照片优化与局部编辑多方面。大量实验结果表明,具表现力的指令对基于指令的图像编辑至关重要,且我们的 MGIE 能在保持具竞争力推理效率的同时,带来自动指标与人类评估的显著提升。

关键词

引用

@article{arxiv.2309.17102,
  title  = {Guiding Instruction-based Image Editing via Multimodal Large Language Models},
  author = {Tsu-Jui Fu and Wenze Hu and Xianzhi Du and William Yang Wang and Yinfei Yang and Zhe Gan},
  journal= {arXiv preprint arXiv:2309.17102},
  year   = {2024}
}

备注

ICLR'24 (Spotlight) ; Project at https://mllm-ie.github.io ; Code at https://github.com/tsujuifu/pytorch_mgie