中文

微调 InstructPix2Pix 实现高级图像上色

计算机视觉与模式识别 2023-12-11 v1 人工智能

摘要

本文提出了一种新颖的人像上色方法,通过微调 InstructPix2Pix 模型实现,该模型集成了语言模型(GPT-3)与文本到图像模型(Stable Diffusion)。尽管原始 InstructPix2Pix 模型擅长基于文本指令编辑图像,但在专注的上色领域表现出局限性。为解决此问题,我们使用 IMDB-WIKI 数据集对模型进行了微调,将黑白图像与 ChatGPT 生成的一组多样化上色提示配对。本文的贡献在于:(1) 将微调技术应用于 Stable Diffusion 模型,专门用于上色任务;(2) 采用生成模型创建多样化的条件提示。微调后,我们的模型在多个指标上定量优于原始 InstructPix2Pix 模型,并定性生成了色彩更逼真的图像。本项目的代码提供在 GitHub 仓库 https://github.com/AllenAnZifeng/DeepLearning282。

关键词

引用

@article{arxiv.2312.04780,
  title  = {Fine-Tuning InstructPix2Pix for Advanced Image Colorization},
  author = {Zifeng An and Zijing Xu and Eric Fan and Qi Cao},
  journal= {arXiv preprint arXiv:2312.04780},
  year   = {2023}
}