中文

利用基于上下文感知的复制粘贴丰富图像内容

计算机视觉与模式识别 2025-05-22 v2

摘要

数据增强在深度学习中是一个广泛使用的技术,尤其是在图像分类、语义分割和目标检测等任务中。其中,复制粘贴(Copy-Paste)是一种简单而有效的方法,近期受到广泛关注。然而,现有的复制粘贴方法往往忽略了源图像和目标图像之间的上下文相关性,导致生成输出存在不一致性。为解决这一挑战,我们提出了一种基于上下文感知的方法,集成了双向潜在信息传递(BLIP)用于从源图像中提取内容。通过将提取的内容信息与类别信息进行匹配,我们的方法确保了目标对象在使用分段模型(SAM)和你只看一次(YOLO)的条件下实现一致的集成。该方法无需手动标注,提供了一个自动化且用户友好的解决方案。跨多个数据集的实验评估表明,我们的方法在提高数据多样性和生成高质量伪图像方面,对各种计算机视觉任务都具有有效作用。

关键词

引用

@article{arxiv.2407.08151,
  title  = {Enrich the content of the image Using Context-Aware Copy Paste},
  author = {Qiushi Guo},
  journal= {arXiv preprint arXiv:2407.08151},
  year   = {2025}
}