中文

十的生成幂

计算机视觉与模式识别 2024-05-24 v2 人工智能 计算与语言 图形学

摘要

我们提出了一种利用文本到图像模型在多个图像尺度上生成一致内容的方法,实现了对场景的极端语义缩放,例如从森林的广角景观视图一直放大到停在树枝上的昆虫的微距特写。我们通过一种联合多尺度扩散采样方法实现了这一点,该方法在保持每个单独采样过程完整性的同时,鼓励不同尺度之间的一致性。由于每个生成的尺度由不同的文本提示引导,我们的方法比传统的超分辨率方法能够实现更深层次的缩放,后者在差异巨大的尺度上可能难以创建新的上下文结构。我们将我们的方法与图像超分辨率和图像外绘制的替代技术进行了定性比较,并表明我们的方法在生成一致的多尺度内容方面最为有效。

关键词

引用

@article{arxiv.2312.02149,
  title  = {Generative Powers of Ten},
  author = {Xiaojuan Wang and Janne Kontkanen and Brian Curless and Steve Seitz and Ira Kemelmacher and Ben Mildenhall and Pratul Srinivasan and Dor Verbin and Aleksander Holynski},
  journal= {arXiv preprint arXiv:2312.02149},
  year   = {2024}
}

备注

Project page: https://powers-of-10.github.io/