中文

语言模型可解释性的全局到局部支持谱

机器学习 2024-08-13 v1 计算与语言

摘要

现有基于样本的方法,如影响函数和表示器点,衡量训练点的重要性时通过近似其从训练中移除的效果。因此,这些方法偏向于离群点和靠近决策边界的点。这些方法提供的解释往往是静态的,且不够具体以适应不同的测试点。在本文中,我们提出了一种生成支持谱(support spectrum)的方法,其基于两个核心思想:支持集(support set)和全局到局部重要性度量(global-to-local importance measure)。支持集是预测类别中训练点的集合,这些训练点“位于”测试点与其他类别训练点之间。它们指示测试点与非预测类别点的区分程度。全局到局部重要性度量通过解耦现有方法中的全局与局部分量来获得,然后用于选择支持集中的点。使用该方法,我们能够为特定测试点生成量身定制的解释。在实验中,我们在图像分类和文本生成任务上展示了该方法的有效性。

关键词

引用

@article{arxiv.2408.05976,
  title  = {Global-to-Local Support Spectrums for Language Model Explainability},
  author = {Lucas Agussurja and Xinyang Lu and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2408.05976},
  year   = {2024}
}