中文

基于 RKE 得分的扩散模型可扩展提示感知多样性与新颖性引导 (SPARKE)

计算机视觉与模式识别 2025-10-31 v2 人工智能 机器学习

摘要

扩散模型在高保真图像合成和提示引导的生成建模方面显示出惊人的成功。然而,确保提示引导扩散模型生成样本具有足够的多样性仍是一个挑战,尤其是当提示涵盖广泛的语义范围且需要以提示感知的方式对生成数据的多样性进行评估时。最近的方法通过多样性度量来引导以鼓励更具多样性的生成。本文通过提出面向提示感知多样性引导的可扩展 R\'eny 核熵多样性引导方法(SPARKE),扩展了基于多样性度量的方法。SPARKE 利用条件熵进行多样性引导,这会动态地基于相似提示对多样性进行度量,从而实现提示感知的多样性控制。虽然基于熵的引导方法提高了提示感知的多样性,但其对基于矩阵的熵得分的依赖在大规模生成设置下带来了计算挑战。为此,我们聚焦于条件潜在 RKE 得分引导的特殊情况,将一般熵测度的 O(n3)O(n^3) 复杂度降低到 O(n)O(n)。降低的计算复杂度使我们能够在不同提示上进行数千轮的多样性引导采样。我们在几个文本到图像扩散模型上对 SPARKE 方法进行数值测试,证明了该方法在不显著增加计算成本的情况下提高了生成数据的提示感知多样性。我们在项目页面发布了代码:https://mjalali.github.io/SPARKE

关键词

引用

@article{arxiv.2506.10173,
  title  = {SPARKE: Scalable Prompt-Aware Diversity and Novelty Guidance in Diffusion Models via RKE Score},
  author = {Mohammad Jalali and Haoyu Lei and Amin Gohari and Farzan Farnia},
  journal= {arXiv preprint arXiv:2506.10173},
  year   = {2025}
}