中文

基于位置查询与扩散模型的一步连续多倍图像外推

计算机视觉与模式识别 2024-01-30 v1

摘要

图像外推旨在生成输入子图像超出其原始边界的内容。这是内容生成中的一项重要任务,但对生成模型而言仍是一个开放问题。本文在文献中尚未解决的两个方向上推动了图像外推的技术前沿:1)任意且连续多倍的外推(无限制),以及2)单步外推(即使对于大扩展倍数)。此外,我们开发了一种不依赖预训练骨干网络的方法,这与之前的SOTA外推方法通常所需的条件形成对比。任意多倍外推是通过在训练期间利用来自同一图像的随机裁剪视图来捕获任意相对位置信息而实现的。具体而言,通过将一个视图和位置嵌入作为查询输入,我们可以重建另一个视图。在推理时,通过输入锚点图像及其对应的位置嵌入,我们生成具有任意扩展倍数的图像。这里的一步外推能力尤为值得关注,相比之下,之前的方法需要执行NN次才能获得其基本固定倍数的NN倍的最终倍数。我们在公开基准上评估了所提出的方法(由于我们采用基于扩散的生成器作为其载体,并在我们提出的\textbf{P}ositional \textbf{Q}uery方案下,因此称为PQDiff),证明了其优于SOTA方法的性能。具体而言,PQDiff在Scenery(\textbf{21.512})、Building Facades(\textbf{25.310})和WikiArts(\textbf{36.212})数据集上取得了SOTA的FID分数。此外,在2.25x、5x和11.7x外推设置下,PQDiff仅需基准SOTA方法\textbf{40.6\%}、\textbf{20.3\%}和\textbf{10.2\%}的时间。

关键词

引用

@article{arxiv.2401.15652,
  title  = {Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach},
  author = {Shaofeng Zhang and Jinfa Huang and Qiang Zhou and Zhibin Wang and Fan Wang and Jiebo Luo and Junchi Yan},
  journal= {arXiv preprint arXiv:2401.15652},
  year   = {2024}
}

备注

ICLR 2024 accepted