关于视觉语言模型在艺术史中的可解释性
计算机视觉与模式识别
2026-02-25 v1
摘要
视觉语言模型(VLM)将视觉和文本数据转换为共享的嵌入空间,从而实现广泛的多模态任务,同时也引发了关于机器“理解”本质的关键问题。本文考察了可解释人工智能(XAI)方法如何在艺术史语境中使视觉语言模型(如 CLIP)的视觉推理变得可理解。为此,我们评估了七种方法,结合零样本局部化实验与人类可解释性研究。我们的结果表明,虽然这些方法捕捉了一些人类解释的方面,但其有效性取决于所检验类别的概念稳定性和表征可用性。
引用
@article{arxiv.2602.20853,
title = {On the Explainability of Vision-Language Models in Art History},
author = {Stefanie Schneider},
journal= {arXiv preprint arXiv:2602.20853},
year = {2026}
}