中文

用于大图生成的学习表示引导扩散模型

计算机视觉与模式识别 2024-03-29 v2

摘要

为了合成高保真样本,扩散模型通常需要辅助数据来引导生成过程。然而,在组织病理学和卫星图像等专业领域,获取费力的块级标注是不切实际的;这通常由领域专家完成,并涉及数亿个图像块。现代自监督学习 (SSL) 表示编码了丰富的语义和视觉信息。在本文中,我们假设此类表示具有足够的表达能力,可作为细粒度人类标签的代理。我们引入了一种新颖的方法,训练以 SSL 嵌入为条件的扩散模型。我们的扩散模型成功地将这些特征投影回高质量的组织病理学和遥感图像。此外,我们通过组装从 SSL 嵌入推断出的空间一致的图像块来构建更大的图像,同时保留长程依赖性。通过生成真实图像的变体来增强真实数据,可以提高块级和更大图像尺度分类任务的下游分类器精度。我们的模型即使在训练期间未遇到的数据集上也很有效,证明了其鲁棒性和泛化能力。从学习嵌入生成图像与嵌入源无关。用于生成大图像的 SSL 嵌入既可以从参考图像中提取,也可以从以任何相关模态(例如类别标签、文本、基因组数据)为条件的辅助模型中采样。作为概念验证,我们引入了文本到大图像合成范式,在该范式中,我们成功地从文本描述合成了大型病理和卫星图像。

关键词

引用

@article{arxiv.2312.07330,
  title  = {Learned representation-guided diffusion models for large-image generation},
  author = {Alexandros Graikos and Srikar Yellapragada and Minh-Quan Le and Saarthak Kapse and Prateek Prasanna and Joel Saltz and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2312.07330},
  year   = {2024}
}