中文

LAKE-RED: 基于潜在背景知识检索增强扩散的伪装图像生成

计算机视觉与模式识别 2024-07-15 v4

摘要

伪装视觉感知是一项重要的视觉任务,具有众多实际应用。由于昂贵的采集和标注成本,该领域面临一个主要瓶颈:其数据集的物种类别仅限于少量目标物种。然而,现有的伪装生成方法需要手动指定背景,因此无法以低成本方式扩展伪装样本的多样性。本文提出了一种潜在背景知识检索增强扩散模型(LAKE-RED)用于伪装图像生成。据我们所知,我们的贡献主要包括:(1) 首次提出了一种无需接收任何背景输入的伪装生成范式。(2) 我们的LAKE-RED是首个具有可解释性的知识检索增强伪装生成方法,其中我们提出将知识检索与推理增强显式分离,以缓解任务特定挑战。此外,我们的方法不限于特定的前景目标或背景,为将伪装视觉感知扩展到更多样化的领域提供了潜力。(3) 实验结果表明,我们的方法优于现有方法,生成了更逼真的伪装图像。

关键词

引用

@article{arxiv.2404.00292,
  title  = {LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented Diffusion},
  author = {Pancheng Zhao and Peng Xu and Pengda Qin and Deng-Ping Fan and Zhicheng Zhang and Guoli Jia and Bowen Zhou and Jufeng Yang},
  journal= {arXiv preprint arXiv:2404.00292},
  year   = {2024}
}

备注

Accepted by CVPR 2024, Fig.2 and Equation 4 revised