CLIP是否以相同方式看待艺术品?
计算机视觉与模式识别
2025-10-29 v2 多媒体
摘要
CLIP作为一种能够通过联合嵌入连接图像和文本的强大多模态模型,已成为重要工具,但它是否以相同的方式‘看’待艺术品——尤其是在解释艺术品时?本文调查了CLIP从绘画中提取高级语义和风格信息的能力,包括人类创作和AI生成的图像。我们在多个维度上评估其感知能力:内容、场景理解、艺术风格、历史时期以及视觉变形或损伤的存在。通过设计针对性探测任务并比较CLIP的响应与人类标注和专家基准,我们探讨了其在感知和情境理解方面的对齐情况。我们的发现揭示了CLIP在视觉表征方面的优势与局限,特别是在审美线索和艺术意图方面。我们进一步讨论了这些见解对将CLIP用作生成过程(如风格迁移或基于提示的图像合成)指导机制的意义。本工作凸显了在创意领域(其中细微差别和主观性起主导作用)应用多模态系统时,对更深层解释性的需求。
引用
@article{arxiv.2505.05229,
title = {Does CLIP perceive art the same way we do?},
author = {Andrea Asperti and Leonardo Dessì and Maria Chiara Tonetti and Nico Wu},
journal= {arXiv preprint arXiv:2505.05229},
year = {2025}
}