改变的 LoRA:从单组前后图像对生成编辑指令的 LoRA 学习框架
计算机视觉与模式识别
2024-12-10 v3
摘要
本文提出了一种用于图像编辑的 LoRA of Change (LoC) 框架,基于视觉指令,即前后图像对。与自然语言存在的歧义、不够具体以及多样化的解释不同,视觉指令能够准确反映用户的意图。基于 LoRA 在文本图像编辑与生成方面的成功,我们动态学习一种针对特定指令的 LoRA 来编码前后图像对之间的“变化”,增强模型的可解释性和可重用性。此外,通常需要四元数据(即前后图像对,以及查询图像和目标图像)的视觉指令图像编辑通用模型由于数据稀缺,受限于视觉指令的范围。为克服这一限制,我们引入了 LoRA 逆向优化技术,仅使用配对数据即可进行大规模训练。广泛的定性和定量实验表明,我们的模型能够生成高质量的图像,符合用户意图,并支持广泛的现实场景视觉指令。
引用
@article{arxiv.2411.19156,
title = {LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair},
author = {Xue Song and Jiequan Cui and Hanwang Zhang and Jiaxin Shi and Jingjing Chen and Chi Zhang and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2411.19156},
year = {2024}
}