中文

Scendi得分:基于CLIP嵌入 Schur 补数实现的提示感知多样性评估

计算机视觉与模式识别 2025-08-05 v3

摘要

CLIP嵌入用于评估文本到图像生成模型所产生样本的忠实度已在文献中广泛探索。虽然广泛采用的CLIPScore基于文本和图像嵌入的余弦相似度有效衡量了生成图像与文本的对齐程度,但它并未量化文本到图像模型生成图像的多样性。本文扩展了CLIP嵌入的应用,以量化和解释由文本到图像模型负责的、即从相似文本提示生成多样图像的内在多样性,我们将其称为提示感知多样性。为此,我们提出了将CLIP基核协方差矩阵分解为文本基成分和非文本基成分的方法。通过对联合图像-文本核协方差矩阵的Schur补数进行分解,实现了该分解,并将分解后成分的矩阵基熵定义为Scendi得分(Schur Complement ENtropy DIversity),作为引导式生成模型的提示感知多样性度量。此外,我们讨论了基于Schur补数分解的nullify给定提示对图像CLIP嵌入影响的应用,以实现对嵌入向量在特定对象上的聚焦或去聚焦。我们 presented several numerical results that apply our proposed Scendi score to evaluate text-to-image and LLM (text-to-text) models.我们的numerical结果表明,Scendi得分在捕获引导式生成模型的内在多样性方面取得了成功。该代码库已公开于 https://github.com/aziksh-ospanov/scendi-score。

关键词

引用

@article{arxiv.2412.18645,
  title  = {Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings},
  author = {Azim Ospanov and Mohammad Jalali and Farzan Farnia},
  journal= {arXiv preprint arXiv:2412.18645},
  year   = {2025}
}