中文

SemAug:通过语言定位实现面向目标检测的语义有意义图像增强

计算机视觉与模式识别 2025-05-21 v1

摘要

数据增强是提升深度神经网络泛化能力的一项关键技术。现有大多数图像域增强方法要么依赖几何与结构变换,要么施加各类光度失真。在本文中,我们提出一种有效的图像增强技术,通过将具有上下文意义的知识注入场景中来增强图像。我们这种通过语言定位实现语义有意义的目标检测图像增强方法SemAug,首先计算可放置在图像相关位置上的语义合适新物体(即“是什么”和“在哪里”问题),然后将这些物体嵌入其相关目标位置,从而促进物体实例分布的多样性。我们的方法允许引入训练集中甚至可能不存在的新物体实例与类别。此外,它不需要训练上下文网络的额外开销,因此可轻松添加到现有架构中。我们全面的评估表明,所提方法在泛化提升上非常有效,而开销可忽略不计。具体而言,对于广泛的模型架构,我们的方法在Pascal VOC和COCO数据集的目标检测任务上分别实现了约2-4%和约1-2%的mAP提升。

关键词

引用

@article{arxiv.2208.07407,
  title  = {SemAug: Semantically Meaningful Image Augmentations for Object Detection Through Language Grounding},
  author = {Morgan Heisler and Amin Banitalebi-Dehkordi and Yong Zhang},
  journal= {arXiv preprint arXiv:2208.07407},
  year   = {2025}
}