中文

PhotoDoodle:基于少量配对数据的艺术图像编辑学习

计算机视觉与模式识别 2025-02-25 v2

摘要

我们提出 PhotoDoodle,一种新的图像编辑框架,旨在通过在照片上叠加装饰性元素来实现照片涂鸦,从而帮助艺术家更轻松地进行创作。照片涂鸦具有挑战性,因为插入的元素必须与背景无缝融合,要求实现真实的融合、透视对齐和情境一致性。此外,背景必须保持不变且不产生畸变,艺术家的独特风格也需从有限的训练数据中高效捕获。这些要求都未被之前的方法所满足,因为这些方法主要关注全局风格迁移或局部填充。我们提出的方法 PhotoDoodle 采用两阶段训练策略。首先,我们使用大规模数据训练一个通用图像编辑模型 OmniEditor。随后,我们使用 EditLoRA 对该模型进行微调,利用由艺术家精选的前后图像对组成的小型数据集来捕获独特的编辑风格和技巧。为增强生成结果的一致性,我们引入了位置编码复用机制。此外,我们发布了一个包含六种高质量风格的 PhotoDoodle 数据集。广泛的实验表明,我们的方法在定制化图像编辑方面表现出 advanced 的性能和鲁棒性,为艺术创作开辟了新的可能性。

关键词

引用

@article{arxiv.2502.14397,
  title  = {PhotoDoodle: Learning Artistic Image Editing from Few-Shot Pairwise Data},
  author = {Shijie Huang and Yiren Song and Yuxuan Zhang and Hailong Guo and Xueyin Wang and Mike Zheng Shou and Jiaming Liu},
  journal= {arXiv preprint arXiv:2502.14397},
  year   = {2025}
}