面向小对象编辑的高效蒸馏方法——SOEDiff
计算机视觉与模式识别
2025-01-03 v3
摘要
本文探讨了一种新任务,即小对象编辑 (small object editing, SOE),其关注文本驱动的受限小尺寸区域图像填充。尽管当前图像填充方法取得了显著成功,但将其应用于 SOE 任务通常会导致对象缺失、文本图像不匹配和失真等失败案例。这些失败源于训练数据集中对小尺寸对象的有限使用以及 U-Net 模型的下采样操作,阻碍了准确生成。为克服这些挑战,我们引入一种新颖的训练方法——SOEDiff,旨在增强基线模型如 StableDiffusion 在编辑小尺寸对象方面的能力,同时最小化训练成本。具体而言,我们的方法包含两个关键组件:SO-LoRA 高效微调低秩矩阵,以及 Cross-Scale Score Distillation loss 利用预训练教师扩散模型的高分辨率预测。我们的方法在来自 MSCOCO 和 OpenImage 的测试数据集上取得显著提升,验证了我们方法在小对象编辑中的有效性。特别地,当将 SOEDiff 与 SD-I 模型在 OpenImage-f 数据集上进行比较时,我们观察到 CLIP-Score 提升 0.99,FID 降低 2.87。
引用
@article{arxiv.2405.09114,
title = {SOEDiff: Efficient Distillation for Small Object Editing},
author = {Yiming Wu and Qihe Pan and Zhen Zhao and Zicheng Wang and Sifan Long and Ronghua Liang},
journal= {arXiv preprint arXiv:2405.09114},
year = {2025}
}
备注
preprint