基于网页规模图像对的条件扩散生成多样图像变体
高能物理 - 理论
2024-05-24 v1 量子物理
摘要
生成图像变体——即在保持语义上下文的前提下产生输入图像的多种变体——日益受到关注。当前图像变体技术涉及改进文本到图像模型以重建输入图像,同时以相同图像为条件。我们首先演示,针对输入图像从冻结嵌入重建的扩散模型,可生成轻微变体。其次,灵感来自文本到图像模型从网页规模文本图像对中学习,我们探索了新的预训练策略以生成图像变体。我们的扩散模型"Semantica"接收来自网页的随机(编码)图像作为条件输入,并对来自同一网页的另一随机噪声图像进行去噪。我们仔细考察了各种图像编码器的设计选择,因其在提取输入图像相关上下文方面至关重要。训练完成后,"Semantica"可仅通过使用数据集中的图像作为输入,自适应生成数据集中的新图像。最后,我们识别了标准图像一致性指标评估图像变体的局限性,提出了基于few-shot生成的替代指标。
关键词
引用
@article{arxiv.2405.14856,
title = {The Channel Capacity of a Relativistic String},
author = {Adam R. Brown},
journal= {arXiv preprint arXiv:2405.14856},
year = {2024}
}