中文

CamDiff:基于扩散模型的伪装图像增强

计算机视觉与模式识别 2023-04-13 v1

摘要

新兴的伪装目标检测(COD)领域旨在识别融入背景的物体。尽管近期模型表现令人印象深刻,我们发现其鲁棒性存在局限,现有方法可能将显著物体误分类为伪装物体,尽管这两种特征相互矛盾。该局限可能源于缺乏多模式训练图像,导致显著性鲁棒性不足。为解决此问题,我们提出 CamDiff,一种受 AI 生成内容(AIGC)启发、克服多模式训练图像稀缺性的新方法。具体而言,我们利用潜在扩散模型在伪装场景中合成显著物体,同时使用对比语言-图像预训练(CLIP)模型的零样本图像分类能力防止合成失败并确保合成物体与输入提示一致。因此,合成图像在保留原始伪装标签的同时融入了显著物体,产生具有更丰富特征的伪装样本。用户研究表明,我们的框架合成的场景中的显著物体更能吸引用户注意;因此,此类样本对现有 COD 模型构成更大挑战。我们的方法支持灵活编辑并以低成本高效生成大规模数据集。它显著增强了 COD 基线的训练与测试阶段,强调了跨多样领域的鲁棒性。我们新生成的数据集与源代码发布于 https://github.com/drlxj/CamDiff。

关键词

引用

@article{arxiv.2304.05469,
  title  = {CamDiff: Camouflage Image Augmentation via Diffusion Model},
  author = {Xue-Jing Luo and Shuo Wang and Zongwei Wu and Christos Sakaridis and Yun Cheng and Deng-Ping Fan and Luc Van Gool},
  journal= {arXiv preprint arXiv:2304.05469},
  year   = {2023}
}