用于解释表征的对比语料归因
机器学习
2023-06-14 v2 人工智能
计算机视觉与模式识别
摘要
尽管无监督模型被广泛使用,专为解释它们设计的方法却极少。多数解释方法解释标量模型输出。然而,无监督模型输出表征向量,其元素因缺乏语义意义而不适合作为解释对象。为弥补此缺口,近期工作定义了标量解释输出:在表征空间中与被解释样本(即 explicand)的基于点积相似性。虽此举启用了对无监督模型的解释,该方法的解释仍可能不透明,因为与被解释样本表征的相似性对人类而言未必有意义。为此,我们提出对比语料相似性,一种基于参考语料与对比foil样本集的、新颖且具语义意义的标量解释输出。我们证明对比语料相似性与许多事后特征归因方法兼容,可生成对比语料归因(COCOA),并从定量上验证了对语料重要的特征被识别出来。我们以两种方式展示 COCOA 的效用:(i)在对比学习设定(SimCLR)中通过解释同一图像的不同增广获得洞见;以及(ii)通过解释图像表征与联合学习的文本表征(CLIP)的相似性,进行零样本物体定位。
引用
@article{arxiv.2210.00107,
title = {Contrastive Corpus Attribution for Explaining Representations},
author = {Chris Lin and Hugh Chen and Chanwoo Kim and Su-In Lee},
journal= {arXiv preprint arXiv:2210.00107},
year = {2023}
}
备注
Updated for the final camera-ready version of ICLR 2023