评估视觉语言模型与扩散模型中的组合泛化能力
计算机视觉与模式识别
2025-08-29 v1 人工智能
摘要
自然语言语义的一个基本方面是:可以通过组合先前已知的部分来形成新含义。近年来,视觉语言模型(VLM)取得了显著进展,但证据表明它们无法进行这种组合。例如,给定一个红色立方体和蓝色圆柱的图像,类似 CLIP 的 VLM 可能会被错误地标记为红色圆柱或蓝色立方,表明其将图像表示为“词袋”,未能捕捉组合语义。近期扩散模型因其出色的生成能力而受到广泛关注,基于扩散模型的零样本分类器在某些组合任务中表现出与 CLIP 相当的水平。本文我们探讨了生成式扩散分类器在组合泛化能力上是否优于判别式模型。我们对 Diffusion Classifier、CLIP 和 ViLT 三个模型进行评估,其在零样本学习(ZSL)和广义零样本学习(GZSL)设置下绑定对象与属性及关系的能力。我们的结果表明,Diffusion Classifier 和 ViLT 在概念绑定任务中表现良好,但所有模型在关系 GZSL 任务中均显著困难,凸显了 VLM 在关系推理方面的更广泛挑战。对 CLIP 嵌入的分析表明,难度可能源于关系概念(如左和右)的表示过于相似。代码和数据集均可在 https://github.com/otmive/diffusion_classifier_clip 获取。
引用
@article{arxiv.2508.20783,
title = {Evaluating Compositional Generalisation in VLMs and Diffusion Models},
author = {Beth Pearson and Bilal Boulbarss and Michael Wray and Martha Lewis},
journal= {arXiv preprint arXiv:2508.20783},
year = {2025}
}
备注
11 pages including references, 6 figures. Accepted at IWCS 2025