中文

揭示故障:对CLIP图像编码错误的深度探究

计算机视觉与模式识别 2024-07-02 v1

摘要

理解人工智能领域领先模型的局限性与弱点,对于其改进和负责任应用至关重要。本研究聚焦于CLIP模型,该模型因其将视觉与语言处理集成而备受推崇。我们的目标是揭示CLIP图像理解中反复出现的問題和盲点。通过深入探讨CLIP与人类图像理解的共同点与差异,我们增进了对这些模型能力的认识。通过我们的分析,我们揭示了CLIP对图像解释与人类感知之间存在显著差异,为改进这些差异提供了方向。我们的方法包括CLIP的差异分析框架(Discrepancy Analysis Framework, DAF)和 transformative caption analysis for CLIP(TCAC),使我们能够全面评估CLIP的性能。我们识别出14项系统性缺陷,包括动作与静态混淆、未能识别图像中物体的运动方向或位置、对水类特征的幻觉、对地理语境的错误归因等。通过解决这些局限性,我们为开发更准确和细致的图像嵌入模型奠定了基础,为人工智能领域的进步做出了贡献。

关键词

引用

@article{arxiv.2407.00592,
  title  = {Unveiling Glitches: A Deep Dive into Image Encoding Bugs within CLIP},
  author = {Ayush Ranjan and Daniel Wen and Karthik Bhat},
  journal= {arXiv preprint arXiv:2407.00592},
  year   = {2024}
}