基于词元级分解的自回归语言模型隐状态以分析模型预测
计算与语言
2023-06-06 v2 人工智能
摘要
尽管近期学界高度关注研究基于 Transformer 的大语言模型为何做出此类预测,但各层内执行的复杂计算使其行为 somewhat 不透明。为缓解此不透明性,本文提出一种基于每个初始输入词元的自回归语言模型最终隐状态的线性分解,该分解对几乎所有当代 Transformer 架构都是精确的。该分解允许定义消融特定输入词元贡献的概率分布,从而仅需模型一次前向传播即可分析其对后续词序列上模型概率的影响。以词元概率的变化作为重要性度量,本文首先考察哪些上下文词对语言模型预测贡献最大。回归实验表明,基于 Transformer 的语言模型主要依赖搭配关联,其次依赖句法依存和共指关系等语言因素来进行下一词预测。此外,利用这些度量预测句法依存和共指提及跨度的分析表明,搭配关联与相同词元的重复在很大程度上解释了语言模型在这些任务上的预测。
引用
@article{arxiv.2305.10614,
title = {Token-wise Decomposition of Autoregressive Language Model Hidden States for Analyzing Model Predictions},
author = {Byung-Doh Oh and William Schuler},
journal= {arXiv preprint arXiv:2305.10614},
year = {2023}
}
备注
ACL 2023