中文

超越像素:基于视觉语言模型的参考引导合成中身份保留评估

计算机视觉与模式识别 2025-11-12 v1 人工智能

摘要

在生成模型中评估身份保留始终是一个关键且尚未解决的挑战。现有的指标依赖于全局嵌入或粗糙的 VLM 提示,无法捕捉细粒度的身份变化,提供有限的诊断性见解。我们引入 Beyond the Pixels,一个分层评估框架,将身份评估分解为特征层次转换。我们的 метод指导 VLMs 通过结构化推理进行决策:(1)将主体分解为 (type, style) -> attribute -> feature 决策树,(2)针对具体转换而非抽象相似性评分进行提示。这一分解将 VLM 分析 grounding 在可验证的视觉证据上,减少幻觉并提高一致性。我们在四个最先进的生成模型上进行了验证,证明该框架在衡量身份一致性方面与人类判断高度一致。此外,我们引入了一个新的基准,专为压力测试生成模型而设计。该基准包含 1,078 张图像-提示对,涵盖多样化的主体类型,包括后备类别,如拟人化和动画角色,每条提示平均涉及六至七个转换轴。

关键词

引用

@article{arxiv.2511.08087,
  title  = {Beyond the Pixels: VLM-based Evaluation of Identity Preservation in Reference-Guided Synthesis},
  author = {Aditi Singhania and Krutik Malani and Riddhi Dhawan and Arushi Jain and Garv Tandon and Nippun Sharma and Souymodip Chakraborty and Vineet Batra and Ankit Phogat},
  journal= {arXiv preprint arXiv:2511.08087},
  year   = {2025}
}