中文

基于变分语言概念的解释性基石语言模型

机器学习 2024-10-30 v2 人工智能 计算与语言 机器学习

摘要

基石语言模型 (FLMs) 如 BERT 及其变体在自然语言处理领域取得了显著的成功。迄今为止,FLMs 的可解释性主要依赖于其自注意力层中的注意力权重。然而,这些注意力权重仅提供词级别的解释,无法捕捉更高层次的结构,因而在可读性和直观性方面不足。为此,我们首先提供了概念解释的形式定义,然后提出了一种变分贝叶斯框架,称为 VAriational Language Concept (VALC),以超越词级别解释,提供概念级别的解释。我们的理论分析表明,VALC 找到最优语言概念来解释 FLM 预测。在多个真实世界数据集上的经验结果表明,我们的方法能够成功为 FLMs 提供概念解释。

关键词

引用

@article{arxiv.2410.03964,
  title  = {Variational Language Concepts for Interpreting Foundation Language Models},
  author = {Hengyi Wang and Shiwei Tan and Zhiqing Hong and Desheng Zhang and Hao Wang},
  journal= {arXiv preprint arXiv:2410.03964},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 Findings