通过多模态大语言模型引导基于指令的图像编辑
计算机视觉与模式识别
2024-02-06 v2
摘要
基于指令的图像编辑借助自然命令提升图像操控的可控性与灵活性,无需精细描述或区域掩码。然而,人类指令有时过于简略,当前方法难以捕捉与遵循。多模态大语言模型(MLLMs)展现出通过 LMs 进行跨模态理解与视觉感知响应生成的潜力。我们探究 MLLMs 如何助力编辑指令,并提出 MLLM 引导的图像编辑(MGIE)。MGIE 学习推导具表现力的指令并提供显式引导。编辑模型通过端到端训练联合捕获该视觉想象并执行操控。我们评估了 Photoshop 风格修改、全局照片优化与局部编辑多方面。大量实验结果表明,具表现力的指令对基于指令的图像编辑至关重要,且我们的 MGIE 能在保持具竞争力推理效率的同时,带来自动指标与人类评估的显著提升。
引用
@article{arxiv.2309.17102,
title = {Guiding Instruction-based Image Editing via Multimodal Large Language Models},
author = {Tsu-Jui Fu and Wenze Hu and Xianzhi Du and William Yang Wang and Yinfei Yang and Zhe Gan},
journal= {arXiv preprint arXiv:2309.17102},
year = {2024}
}
备注
ICLR'24 (Spotlight) ; Project at https://mllm-ie.github.io ; Code at https://github.com/tsujuifu/pytorch_mgie