中文

基于属性的生成模型可解释评价指标

计算机视觉与模式识别 2024-07-18 v3 人工智能

摘要

当训练数据集包含 1:1 的狗与猫比例时,生成 1:1 狗和猫的生成模型比另一生成 3:1 狗和猫的模型更能反映训练物种分布。我们能用现有指标捕捉这一现象吗?遗憾的是不能,因为这些指标除“多样性”外不提供任何可解释性。在此背景下,我们提出一种新的评价协议,用于衡量一组生成图像在属性强度分布上偏离训练集的程度,具体如下。单属性散度(SaD)衡量关于单个属性概率密度函数(PDF)的散度。配对属性散度(PaD)衡量关于一对属性联合 PDF 的散度。它们可指出模型在哪些属性上表现不佳。为衡量图像属性强度,我们提出异质 CLIPScore(HCS),其以异质初始点度量图像与文本向量间的余弦相似度。借助 SaD 和 PaD,我们揭示了现有生成模型的如下情况。ProjectedGAN 会生成不合理的属性关系,例如带胡须的婴儿,尽管其在现有指标上具有竞争性分数。扩散模型难以捕捉数据集中多样的颜色。潜扩散模型较大的采样时间步会生成更多细小物体,包括耳环和项链。Stable Diffusion v1.5 比 v2.1 更好地捕捉属性。我们的指标为生成模型的可解释评价奠定了基础。

关键词

引用

@article{arxiv.2310.17261,
  title  = {Attribute Based Interpretable Evaluation Metrics for Generative Models},
  author = {Dongkyun Kim and Mingi Kwon and Youngjung Uh},
  journal= {arXiv preprint arXiv:2310.17261},
  year   = {2024}
}

备注

Accepted to ICML2024, code: github.com/notou10/sadpad