基于局部与全局语境与对象部件感知的超像素数据增强方法
计算机视觉与模式识别
2025-12-02 v1
摘要
基于剪切粘贴策略的数据增强方法在深度学习中展现出显著的泛化能力。然而,现有方法主要考虑全局语义,仅限于图像级别约束,过度削弱了对判别性局部语境的关注,导致性能提升瓶颈。此外,现有生成增强样本的方法通常涉及裁剪和粘贴矩形或正方形区域,导致对象部件信息丢失。为缓解增强图像与生成混合标签之间不一致的问题,现有方法通常需要双向前向传播或依赖外部预训练网络进行对象居中,这种方法效率低下。为克服上述局限性,我们提出了LGCOAMix,这是一种高效的语境感知和对象部件感知的超像素基于网格混合数据增强方法。据我们了解,这是首次提出针对剪切粘贴数据增强的基于超像素注意力方法的标签混合策略。这也是首次从判别性超像素级区域和跨图像超像素对比中学习局部特征的方法。在various基准数据集上进行的广泛实验表明,LGCOAMix在分类任务上优于当前最先进的剪切粘贴数据增强方法,{并在CUB200-2011上优于弱监督目标定位。}我们已证明LGCOAMix不仅适用于CNN网络,也适用于Transformer网络。源代码可在 https://github.com/DanielaPlusPlus/LGCOAMix 获取。
引用
@article{arxiv.2512.00130,
title = {Local and Global Context-and-Object-part-Aware Superpixel-based Data Augmentation for Deep Visual Recognition},
author = {Fadi Dornaika and Danyang Sun},
journal= {arXiv preprint arXiv:2512.00130},
year = {2025}
}