CLIP纹理-形状偏好的动态演化及其与人类对齐和模型鲁棒性的关系
计算机视觉与模式识别
2025-12-22 v2
摘要
对比语言-图像模型如CLIP已展现出卓越的泛化能力。然而,其内部视觉表征在训练过程中如何演化,以及这种演化如何与人类感知相关联,目前仍知之甚少。现有分析大多描述完全训练好的模型,而忽略了表征偏好和感知对齐的动态过程。在这项工作中,我们对CLIP模型在整个训练过程中进行了逐轮次分析,重点关注纹理-形状偏好的演化、与人类感知判断的对齐以及对图像噪声的敏感性。通过使用涵盖低级图像质量评估、中级感知相似性、显著性对应和噪声鲁棒性的多个感知基准,我们识别出一个一致的、依赖于训练阶段的表征转变。早期训练阶段表现出强烈的纹理偏好、与低级人类感知指标更高的对齐度,以及对高斯噪声扰动的敏感性增加。随着训练的进行,这种纹理偏好逐渐减弱,转而倾向于更多基于形状的表征,同时伴随着对噪声鲁棒性的提高和低级感知对齐的下降。重要的是,这些动态过程在多个CLIP模型规模中一致观察到,表明该现象并非特定于某种架构大小。我们的发现为多模态模型训练过程中感知对齐、特征偏好和鲁棒性如何协同演化提供了实证表征。这项工作揭示了早期低级感知对齐与后期鲁棒性之间的系统性权衡,为视觉-语言模型的表征动态及其与人类视觉处理的关系提供了新的见解。
关键词
引用
@article{arxiv.2508.09814,
title = {On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness},
author = {Pablo Hernández-Cámara and Jose Manuel Jaén-Lorites and Alexandra Gómez-Villa and Jorge Vila-Tomás and Valero Laparra and Jesus Malo},
journal= {arXiv preprint arXiv:2508.09814},
year = {2025}
}