X-Paste:利用 CLIP 与 StableDiffusion 重新审视可扩展的实例分割复制粘贴数据增强
计算机视觉与模式识别
2023-06-01 v2 机器学习
摘要
复制粘贴(Copy-Paste)是一种简单而有效的实例分割数据增强策略。通过将目标实例随机粘贴到新的背景图像上,它能够免费创建新的训练数据,并显著提升分割性能,尤其是对稀有目标类别。尽管在复制粘贴中使用多样且高质量的目标实例能带来更大的性能提升,但以往工作要么利用人工标注的实例分割数据集中的目标实例,要么利用从 3D 目标模型渲染得到的实例,这两种方式都过于昂贵,难以扩展以获得良好的多样性。本文借助新近出现的零样本识别模型(如 CLIP)与文本到图像模型(如 StableDiffusion)的力量,重新审视大规模下的复制粘贴。我们首次证明,使用文本到图像模型为不同目标类别生成图像,或使用零样本识别模型筛选噪声爬取的图像,是使复制粘贴真正可扩展的可行途径。为实现这一成功,我们设计了一个名为“X-Paste”的数据获取与处理框架,并基于此开展了系统性研究。在 LVIS 数据集上,X-Paste 相较于以 Swin-L 为骨干网络的强基线 CenterNet2 取得了令人印象深刻的改进。具体而言,它在所有类别上实现了 +2.6 box AP 与 +2.1 mask AP 的提升,在长尾类别上提升更为显著,分别达到 +6.8 box AP 与 +6.5 mask AP。我们的代码与模型已发布于 https://github.com/yoctta/XPaste。
引用
@article{arxiv.2212.03863,
title = {X-Paste: Revisiting Scalable Copy-Paste for Instance Segmentation using CLIP and StableDiffusion},
author = {Hanqing Zhao and Dianmo Sheng and Jianmin Bao and Dongdong Chen and Dong Chen and Fang Wen and Lu Yuan and Ce Liu and Wenbo Zhou and Qi Chu and Weiming Zhang and Nenghai Yu},
journal= {arXiv preprint arXiv:2212.03863},
year = {2023}
}
备注
ICML 2023, code is available at https://github.com/yoctta/XPaste