中文

SpliceMix:一种用于多标签图像分类的跨尺度与语义混合增强策略

计算机视觉与模式识别 2023-11-28 v1 机器学习

摘要

近来,Mix风格的的数据增强方法(如Mixup与CutMix)在各种视觉任务中展现出良好性能。然而,这些方法主要面向单标签图像设计,忽视了单标签与多标签图像间的显著差别,即多标签图像涉及多个共现类别与多变的目标尺度。另一方面,以往的多标签图像分类(MLIC)方法倾向于设计精细模型,带来高昂计算开销。本文引入一种简单而有效的多标签图像分类增强策略,即SpliceMix。我们方法中的“拼接”有两层含义:1)每张混合图像是以网格形式对若干下采样图像进行拼接而成,其中参与混合的图像语义被融合且无目标缺失,以缓解共现偏差;2)我们将混合图像与原始小批量拼接构成新的SpliceMixed小批量,使不同尺度的图像可共同贡献于训练。此外,SpliceMixed小批量中的此类拼接实现了混合图像与原始常规图像间的交互。我们还基于一致性学习(SpliceMix-CL)给出了简单且无参数的扩展,以展现SpliceMix的灵活可扩展性。在多项任务上的大量实验表明,仅将SpliceMix与基线模型(如ResNet)结合即取得优于SOTA方法的性能。而且,当现有MLIC方法结合我们的SpliceMix时性能提升,进一步验证了SpliceMix的泛化性。代码见https://github.com/zuiran/SpliceMix。

关键词

引用

@article{arxiv.2311.15200,
  title  = {SpliceMix: A Cross-scale and Semantic Blending Augmentation Strategy for Multi-label Image Classification},
  author = {Lei Wang and Yibing Zhan and Leilei Ma and Dapeng Tao and Liang Ding and Chen Gong},
  journal= {arXiv preprint arXiv:2311.15200},
  year   = {2023}
}

备注

13 pages, 10 figures