中文

ChangeDiff:基于扩散模型与灵活文本提示的多时相变化检测数据生成器

计算机视觉与模式识别 2024-12-23 v1 人工智能

摘要

在像素级标注的支持下,数据驱动的深度学习模型在变化检测(CD)领域取得了巨大进展。然而,收集多样化数据并进行人工标注成本高昂、费时费力且需要大量专业知识。现有的用于 CD 数据合成的生成式方法在解决这一问题上展现出竞争潜力,但仍面临以下局限性:1)难以灵活控制变化事件;2)依赖额外数据来训练数据生成器;3)仅关注特定的变化检测任务。为此,本文聚焦于语义 CD(SCD)任务,通过探索强大的扩散模型开发了一个多时相 SCD 数据生成器 ChangeDiff。ChangeDiff 以两步创新方式生成变化数据:首先,利用文本提示和文本到布局(T2L)模型创建连续布局,然后采用布局到图像(L2I)将这些布局转换为图像。具体而言,我们提出了多类分布引导的文本提示(MCDG-TP),允许通过可控的类别及其对应比例灵活生成布局。随后,为了将 T2L 模型推广至所提出的 MCDG-TP,进一步设计了类分布细化损失作为训练监督。为了将文本到图像的扩散模型推广至所提出的 MCDG-TP,设计了类分布细化损失作为训练监督。对于后者,提出了三种模式下的 MCDG-TP,用于从各种文本合成新的布局掩码。我们生成的数据在时间连续性、空间多样性和质量逼真度方面展现出显著进步,赋予了变化检测器更高的准确性和可迁移性。代码可在 https://github.com/DZhaoXd/ChangeDiff 获取。

关键词

引用

@article{arxiv.2412.15541,
  title  = {ChangeDiff: A Multi-Temporal Change Detection Data Generator with Flexible Text Prompts via Diffusion Model},
  author = {Qi Zang and Jiayi Yang and Shuang Wang and Dong Zhao and Wenjun Yi and Zhun Zhong},
  journal= {arXiv preprint arXiv:2412.15541},
  year   = {2024}
}