中文

EditVal:基于扩散的文本引导图像编辑方法基准评测

计算机视觉与模式识别 2023-10-05 v1

摘要

近来,通过利用 Imagen 和 Stable Diffusion 等大规模基于扩散的生成模型的出色能力,已开发出大量文本引导图像编辑方法。然而,并不存在标准化的评估协议来跨不同类型细粒度编辑比较方法。为弥补此差距,我们提出 EditVal,一个用于定量评估文本引导图像编辑方法的标准化基准。EditVal 由精选图像数据集、每幅图像从 13 种可能编辑类型中抽取的一组可编辑属性,以及使用预训练视觉-语言模型评估每种编辑类型生成图像保真度的自动化评估流程组成。我们使用 EditVal 对 8 种前沿的基于扩散的编辑方法(包括 SINE、Imagic 和 Instruct-Pix2Pix)进行基准测试。我们辅以大规模人类研究,表明 EditVal 的自动化评估流程与我们考量编辑类型下的人类偏好强相关。从人类研究与自动化评估中,我们发现:(i)Instruct-Pix2Pix、Null-Text 和 SINE 是跨不同编辑类型平均表现最优的方法,但仅 Instruct-Pix2Pix 和 Null-Text 能够保留原始图像属性;(ii)多数编辑方法在空间操作类编辑(如改变物体位置)上失败;(iii)不存在在一系列不同编辑类型上各自均排名最佳的“赢家”方法。我们希望该基准能为未来开发更可靠的文本引导图像编辑工具铺平道路。我们将公开发布 EditVal 及所有相关代码与人类研究模板,以在 https://deep-ml-research.github.io/editval/ 支持这些研究方向。

关键词

引用

@article{arxiv.2310.02426,
  title  = {EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods},
  author = {Samyadeep Basu and Mehrdad Saberi and Shweta Bhardwaj and Atoosa Malemir Chegini and Daniela Massiceti and Maziar Sanjabi and Shell Xu Hu and Soheil Feizi},
  journal= {arXiv preprint arXiv:2310.02426},
  year   = {2023}
}