CLIP上嵌入位移解剖:增强措施对视觉语言模型表征学习的影响
计算机视觉与模式识别
2026-03-24 v3
摘要
理解视觉语言模型如CLIP在不同数据增强措施下的嵌入位移,为提供机理解释性意义。本研究考察了9种常见数据增强技术对CLIP嵌入位移的影响:噪声、模糊、颜色抖动、尺度与旋转、翻转、弹性与透视变换、随机亮度与对比度、以及像素块的粗略dropout。我们细致分析了在注意力图、patch、边缘、细节保持、余弦相似度、L2距离、两两距离和层次聚类等指标下的嵌入位移,并对样本图像提供了定性分析。我们的发现表明,某些增强措施如噪声、透视变换和尺度平移对嵌入位移影响更大。该研究为未来在VLM的鲁棒性机械解释和对抗数据防御提供了具体基础。本研究的代码实现可在\href{https://github.com/ashimdahal/clip-shift-analysis}{https://github.com/ashimdahal/clip-shift-analysis}获取。
引用
@article{arxiv.2503.23495,
title = {Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning},
author = {Ashim Dahal and Saydul Akbar Murad and Nick Rahimi},
journal= {arXiv preprint arXiv:2503.23495},
year = {2026}
}
备注
accepted at MIV at CVPR 2025