中文

PromptFix:按提示生成并修复图像

计算机视觉与模式识别 2024-10-11 v2

摘要

配备语言模型的扩散模型在图像生成任务中表现出优异的可控性,使图像处理能够遵循人类指令。然而,缺乏多样化的指令跟随数据会阻碍开发有效识别和执行用户自定义指令的模型,尤其是在低层次任务方面。此外,扩散过程的随机性导致在需要详细保留生成图像的图像生成或编辑任务中存在不足。为此,我们提出了 PromptFix,一个综合框架,使扩散模型能够遵循人类指令执行广泛的图像处理任务。首先,我们构建了一个大规模指令跟随数据集,涵盖包括低层次任务、图像编辑和对象创建在内的全面图像处理任务。接着,我们提出了一种高频引导采样方法,显式控制去噪过程并保留未处理区域的高频细节。最后,我们设计了一个辅助提示适配器,利用视觉语言模型 (VLM) 增强文本提示,提高模型的任务泛化能力。实验结果表明,PromptFix 在各种图像处理任务中优于先前方法。我们提出的模型还在推理效率上与这些基线模型相当,并在盲目修复和组合任务中表现出优异的零样本能力。数据集和代码已提供,链接为 https://www.yongshengyu.com/PromptFix-Page。

关键词

引用

@article{arxiv.2405.16785,
  title  = {PromptFix: You Prompt and We Fix the Photo},
  author = {Yongsheng Yu and Ziyun Zeng and Hang Hua and Jianlong Fu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2405.16785},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024