中文

CLIP 处理否定形式的方式与位置

计算与语言 2024-07-16 v1 人工智能

摘要

已提出各种基准来测试 pre-trained vision \& language (VL) 模型的语言理解能力。我们借助 VALSE benchmark (Parcalabescu 等,2022) 中的 existence 任务来测试模型对否定形式的理解,这是一种特别有趣的多模态模型问题。然而,虽然此类 VL benchmark 对测量模型性能有用,但它们无法揭示这些模型在此类 visio-linguistic 任务中到达输出的内部过程。我们借鉴了关于模型可解释性 literature 的不断增长,来解释 VL 模型在否定理解方面的行为。具体而言,我们通过对 CLIP 文本编码器进行深入分析 (Radford 等,2021),这一模型在多模态领域具有重要影响力。我们定位处理否定形式的编码器的部分,并分析注意力头在此任务中的作用。我们的贡献有三个:我们展示了来自语言模型可解释性 literature 的方法(如因果追踪)如何被转化为多模态模型和任务;我们提供了关于 CLIP 在 VALSE existence 任务中处理否定形式的具体见解;我们指出了 VALSE 数据集作为语言理解 benchmark 的内在局限性。

关键词

引用

@article{arxiv.2407.10488,
  title  = {How and where does CLIP process negation?},
  author = {Vincent Quantmeyer and Pablo Mosteiro and Albert Gatt},
  journal= {arXiv preprint arXiv:2407.10488},
  year   = {2024}
}

备注

Accepted at the 3rd Workshop on Advances in Language and Vision Research (ALVR 2024)