AnyEdit:掌握面向任何想法的统一高质量图像编辑
计算机视觉与模式识别
2025-04-01 v3
摘要
指令式图像编辑旨在以自然语言指令修改特定图像元素。然而,当前该领域的模型往往难以准确执行复杂的用户指令,因为其训练数据质量较低且编辑类型有限。我们提出AnyEdit,一个综合性的多模态指令编辑数据集,包含250万对高质量编辑对,覆盖20多种编辑类型和5个领域。通过三个方面确保AnyEdit集合的多样性和质量:初始数据多样性、自适应编辑过程以及自动选择编辑结果。使用该数据集,我们进一步训练了一种 novel AnyEdit Stable Diffusion模型,采用任务感知路由和可学习任务嵌入实现统一图像编辑。在三个基准数据集上的全面实验表明,AnyEdit consistently提升了基于扩散的编辑模型性能。这为开发支持人类创意的指令驱动图像编辑模型提供了前景。
引用
@article{arxiv.2411.15738,
title = {AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea},
author = {Qifan Yu and Wei Chow and Zhongqi Yue and Kaihang Pan and Yang Wu and Xiaoyang Wan and Juncheng Li and Siliang Tang and Hanwang Zhang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2411.15738},
year = {2025}
}
备注
Accepted by CVPR 2025