基于显著性引导的扩散潜在优化
计算机视觉与模式识别
2024-10-15 v1
摘要
随着扩散模型的快速发展,生成基于文本提示的图像已不再具有挑战性。文本到图像生成的关键在于如何优化文本到图像生成模型的结果,使其更好地对齐人类意图或提示。现有优化方法通常对整个图像统一处理,进行全局优化。这些方法忽视了人类视觉系统在观看图像时自然优先关注显著区域,往往忽略不显著或非显著区域的事实。也就是说,人类可能在非显著区域忽略优化。因此,尽管在额外的大规模多模态模型的指导下进行了模型保留,现有方法进行统一优化,导致次优结果。为了有效且高效地解决此对齐挑战,我们提出 Saliency Guided Optimization Of Diffusion Latents(SGOOL)。我们首先使用显著性检测器模拟人类视觉注意力系统,标记出显著区域。为避免训练额外模型,我们的方法直接优化扩散潜在向量。此外,SGOOL 利用可逆扩散过程,赋予其恒定内存实现的优势。因此,我们的方法是一种高效且即插即用的微调方法。进行了大量实验,包括多个指标和人类评估。实验结果表明,SGOOL 在图像质量和提示对齐方面均优于现有方法。
引用
@article{arxiv.2410.10257,
title = {Saliency Guided Optimization of Diffusion Latents},
author = {Xiwen Wang and Jizhe Zhou and Xuekang Zhu and Cheng Li and Mao Li},
journal= {arXiv preprint arXiv:2410.10257},
year = {2024}
}