中文

评估时尚文本到图像生成中的属性混淆

计算机视觉与模式识别 2025-07-10 v1

摘要

尽管文本到图像(T2I)生成模型取得了快速进展,但在涉及复杂构图的领域如时尚,其评估仍具有挑战性。最近的自动化 T2I 评估方法利用预训练的视觉语言模型来衡量跨模态对齐。然而,我们的初步研究表明,这些方法在评估丰富的实体-属性语义方面仍受限,面临属性混淆——即属性被正确呈现但与错误的实体相关联的挑战。为此,我们基于针对单个实体的视觉问答(VQA)局部化策略,在视觉和文本模态中进行局部化。我们提出了局部化的人类评估协议,并引入了一种新型自动度量——局部化 VQA 分数(L-VQAScore),该度量结合了视觉局部化与 VQA 探测,既检测正确(反射)也检测误定位(泄漏)的属性生成。在一个新精选的数据集上,L-VQAScore 在与人类判断相关性方面超过了最先进的 T2I 评估方法,展示了其在捕捉细粒度实体-属性关联方面的优势。我们认为 L-VQAScore 可以是主观评估的可靠且可扩展的替代方案。

关键词

引用

@article{arxiv.2507.07079,
  title  = {Evaluating Attribute Confusion in Fashion Text-to-Image Generation},
  author = {Ziyue Liu and Federico Girella and Yiming Wang and Davide Talon},
  journal= {arXiv preprint arXiv:2507.07079},
  year   = {2025}
}

备注

Accepted to ICIAP25. Project page: site [https://intelligolabs.github.io/L-VQAScore/\