从噪声到细微差别:深度生成式图像模型的进展
计算机视觉与模式识别
2024-12-16 v1 人工智能
摘要
深度学习驱动的图像生成自 2021 年以来经历了范式转变,标志着架构创新和计算创新的根本性突破。通过审阅架构创新和实证结果,本文分析了从传统生成方法向高级架构过渡的过程,重点关注计算高效扩散模型和视觉 Transformer 架构。我们检视了 Stable Diffusion、DALL-E 和一致性模型的最新发展如何重新定义图像合成的能力和性能边界,同时应对效率和质量方面的持久挑战。我们的分析聚焦于潜在空间表示、跨注意力机制以及参数高效训练方法,这些方法在资源受限条件下实现加速推理。虽然更高效的训练方法使推理更快,但像 ControlNet 和区域注意力系统这类高级控制机制同时提高了生成精度和内容定制能力。我们调查了增强的多模态理解和零样本生成能力如何在多个行业中重塑实际应用。我们的分析表明,尽管生成质量和计算效率取得了显著进展,但开发面向工业应用的资源导意架构和可解释生成系统仍面临关键挑战。本文通过绘制有前景的研究方向,包括神经网络架构优化和可解释生成框架,作出总结。
引用
@article{arxiv.2412.09656,
title = {From Noise to Nuance: Advances in Deep Generative Image Models},
author = {Benji Peng and Chia Xin Liang and Ziqian Bi and Ming Liu and Yichao Zhang and Tianyang Wang and Keyu Chen and Xinyuan Song and Pohsun Feng},
journal= {arXiv preprint arXiv:2412.09656},
year = {2024}
}