GalaxyEdit:用于增删操作的大规模图像编辑数据集
计算机视觉与模式识别
2026-01-21 v2
摘要
大规模文本到图像和图像到图像模型的训练需要大量标注数据。虽然文本到图像数据集丰富,但用于基于指令的数据图像到图像任务(如对象添加和删除)的数据有限。这是由于数据生成过程存在诸多挑战,如显著的人力投入、自动化有限、端到端模型次优、数据多样性受限以及高成本等。我们提出了旨在缓解此类限制的自动化数据生成管道,介绍 GalaxyEdit——一个用于添加和删除操作的大规模图像编辑数据集。我们在数据集上微调了 SD v1.5 模型,发现我们的模型能够成功处理更广泛的对象和复杂的编辑指令,在添加和删除任务中分别以 11.2% 和 26.1% 的 FID 分数超越当前最先进的方法。进一步考虑设备端使用场景,我们将研究扩展到利用 ControlNet-xs 架构进行任务特定的轻量级适配器。虽然 ControlNet-xs 在骨架和深度引导的生成方面表现出色,但我们提出通过基于 Volterra 滤波器的非线性交互层来增强 ControlNet-xs 与 U-Net之间的沟通,以处理更复杂的添加和删除任务。我们的方法在添加/删除和骨架引导的图像生成任务中均优于 ControlNet-xs,凸显了所提改进的有效性。
引用
@article{arxiv.2411.13794,
title = {GalaxyEdit: Large-Scale Image Editing Dataset with Enhanced Diffusion Adapter},
author = {Aniruddha Bala and Rohan Jaiswal and Siddharth Roheda and Rohit Chowdhury and Loay Rashid},
journal= {arXiv preprint arXiv:2411.13794},
year = {2026}
}
备注
10 pages, 6 figures