MaSC:用于评估概念驱动生成的掩码相似度度量
计算机视觉与模式识别
2026-05-22 v1
摘要
评估文本到图像扩散中的单概念个性化,需要衡量概念保留(捕捉对参考图像的身份忠实度)和提示跟随(生成图像场景是否匹配提示)。现有指标通常使用全局图像或文本-图像嵌入(如 CLIP-I、DINO、CLIP-T)来计算这些信号。我们指出,这些指标与人类感知的相关性较差,因为它们整体关注图像,而非将概念主体与背景分离。我们提出 MaSC,一种利用外部提供的前景概念掩码来分解评估的掩码相似度度量。MaSC 将评估分解为基于主体的概念保留和基于背景的提示跟随。MaSC 采用冻结的 SigLIP2 SO400M-NaFlex 特征计算两个分数:概念保留通过前景参考块与生成图像块的掩码最大余弦匹配度衡量,而提示跟随通过比较仅包含背景的池化图像嵌入与已去除主体的提示嵌入来衡量。在 DreamBench++ 人类评分上,MaSC 实现 Krippendorff alpha = 0.471 的概念保留分数,超越所有测试的非大语言模型基线和 GPT-4V,接近 GPT-4o。在 ORIDa 上,MaSC 实现 AUC = 0.992,几乎完美地区分了相同主体与跨主体的图像对。其提示跟随分数也超越了 DreamBench 附带的 CLIP-T 基线。这些结果表明,空间分解聚合是评估概念驱动生成的强大设计原则。
引用
@article{arxiv.2605.22469,
title = {MaSC: A Masked Similarity Metric for Evaluating Concept-Driven Generation},
author = {Patryk Bartkowiak and Lennart Petersen and Bartosz Kotrys and Dominik Michels and Soren Pirk and Wojtek Palubicki},
journal= {arXiv preprint arXiv:2605.22469},
year = {2026}
}
备注
20 pages, 2 figures, 7 tables