通过缓存赋能的稀疏扩散推理加速文本到图像编辑
计算机视觉与模式识别
2024-01-05 v3
摘要
由于扩散模型近期的成功,文本到图像生成日益流行并获得了广泛应用。其中,文本到图像编辑(或连续文本到图像生成)备受关注,并有可能提升生成图像的质量。常见的情况是,用户可能希望通过对其输入文本描述进行细微修改,进行若干轮扩散推理来轻微编辑生成的图像。然而,即便使用GPU加速器,此类图像编辑过程仍受许多现有扩散模型推理效率低下之苦。为解决该问题,我们引入快速图像语义编辑(FISEdit),一种用于高效文本到图像编辑的缓存赋能稀疏扩散模型推理引擎。我们方法背后的关键直觉是利用输入文本上的细微修改与输出图像上受影响区域之间的语义映射。对于每个文本编辑步骤,FISEdit可自动识别受影响的图像区域,并利用缓存的未变化区域特征图来加速推理过程。大量实证结果表明,在NVIDIA TITAN RTX和A100 GPU上,FISEdit分别比现有方法快和,甚至生成更令人满意的图像。
引用
@article{arxiv.2305.17423,
title = {Accelerating Text-to-Image Editing via Cache-Enabled Sparse Diffusion Inference},
author = {Zihao Yu and Haoyang Li and Fangcheng Fu and Xupeng Miao and Bin Cui},
journal= {arXiv preprint arXiv:2305.17423},
year = {2024}
}
备注
AAAI 2024