中文

球面编码器的图像生成

计算机视觉与模式识别 2026-02-17 v1

摘要

我们引入 Sphere Encoder,一种高效的生成框架,能在单次前向传播中生成图像,性能与多步扩散模型相当,仅需少于五步。我们的方法通过学习编码器将自然图像均匀映射到球面潜在空间,再通过解码器将随机潜在向量映射回图像空间。仅通过图像重构损失训练,模型通过解码球面随机点生成图像。我们的架构自然支持条件生成,循环编码器/解码器几次可进一步提升图像质量。在多个数据集上,球面编码器方法在性能上与最先进的扩散模型相当,但推理成本仅为其的一小部分。项目页面地址为 https://sphere-encoder.github.io

关键词

引用

@article{arxiv.2602.15030,
  title  = {Image Generation with a Sphere Encoder},
  author = {Kaiyu Yue and Menglin Jia and Ji Hou and Tom Goldstein},
  journal= {arXiv preprint arXiv:2602.15030},
  year   = {2026}
}

备注

Technical report