MosaicFusion:作为大词汇量实例分割数据增强器的扩散模型
计算机视觉与模式识别
2024-10-07 v2 人工智能
机器学习
摘要
我们提出 MosaicFusion,一种简单而有效的基于扩散的大词汇量实例分割数据增强方法。我们的方法无需训练且不依赖任何标签监督。两个关键设计使我们能够使用现成的文本到图像扩散模型作为有用的物体实例与掩码标注数据集生成器。首先,我们将图像画布划分为若干区域,并执行单轮扩散过程以在不同文本提示条件下同时生成多个实例。其次,我们通过跨层和扩散时间步聚合与物体提示相关的交叉注意力图,再进行简单阈值化和边缘感知精炼处理,获得相应的实例掩码。无需额外技巧,我们的 MosaicFusion 能为稀有和 novel 类别生成大量合成标注数据。在具有挑战性的 LVIS 长尾和开放词汇基准上的实验结果表明,MosaicFusion 能显著提升现有实例分割模型的性能,尤其是对稀有和 novel 类别。代码:https://github.com/Jiahao000/MosaicFusion。
引用
@article{arxiv.2309.13042,
title = {MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation},
author = {Jiahao Xie and Wei Li and Xiangtai Li and Ziwei Liu and Yew Soon Ong and Chen Change Loy},
journal= {arXiv preprint arXiv:2309.13042},
year = {2024}
}
备注
International Journal of Computer Vision (IJCV), 2024