中文

预训练 Transformer 中自注意力的因果解释

人工智能 2023-11-01 v1 机器学习

摘要

我们提出 Transformer 神经网络架构中自注意力的一种因果解释。我们将自注意力解释为针对给定符号(词元)输入序列估计结构方程模型的机制。该结构方程模型又可解释为在输入序列特定上下文下作用于输入符号的因果结构。重要的是,此解释在存在潜混杂因子时依然成立。遵循该解释,我们通过计算最深注意力层中对应表征间的偏相关来估计输入符号间的条件独立关系。这使得可利用现有基于约束的算法学习输入序列上的因果结构。就此意义而言,现有预训练 Transformer 可用于零样本因果发现。我们通过为 Transformer 在两项任务——情感分类(NLP)与推荐——中的输出提供因果解释来演示该方法。

关键词

引用

@article{arxiv.2310.20307,
  title  = {Causal Interpretation of Self-Attention in Pre-Trained Transformers},
  author = {Raanan Y. Rohekar and Yaniv Gurwicz and Shami Nisimov},
  journal= {arXiv preprint arXiv:2310.20307},
  year   = {2023}
}

备注

37th Conference on Neural Information Processing Systems (NeurIPS 2023). arXiv admin note: text overlap with arXiv:2210.10621