BudgetFusion: 感知引导的自适应扩散模型
计算机视觉与模式识别
2024-12-24 v3 人工智能
摘要
扩散模型在文本到图像生成任务中取得了前所未有的成功。虽然这些模型能够生成高质量且逼真的图像,但顺序去噪的复杂性引发了关于高计算需求和能耗的社会担忧。作为回应,人们做出了各种努力来提高推理效率。然而,大多数现有工作采用了固定方法,如神经网络简化或文本提示优化。所有去噪计算带来的质量提升对人类来说是否同样可感知?我们观察到,不同文本提示生成的图像可能需要不同的计算量来实现期望的内容。这一观察促使我们提出了 BudgetFusion,一种建议扩散模型在开始生成图像之前最具感知效率的去噪步数的新模型。这是通过预测相对于去噪步数的多级感知指标来实现的。以流行的 Stable Diffusion 为例,我们进行了数值分析和用户研究。我们的实验表明,BudgetFusion 每个提示可节省多达五秒的时间,同时不损害感知相似性。我们希望这项工作能引发对核心问题的努力:人类每瓦特能量从生成模型创建的图像中获得了多少感知增益?
引用
@article{arxiv.2412.05780,
title = {BudgetFusion: Perceptually-Guided Adaptive Diffusion Models},
author = {Qinchan Li and Kenneth Chen and Changyue Su and Qi Sun},
journal= {arXiv preprint arXiv:2412.05780},
year = {2024}
}