LM Transparency Tool:分析 Transformer 语言模型的交互式工具
计算与语言
2024-04-11 v1
摘要
我们提出了 LM Transparency Tool (LM-TT),一个用于分析基于 Transformer 的语言模型内部工作机制的开源交互式工具包。与以往专注于决策过程孤立部分的现有工具不同,我们的框架旨在使整个预测过程透明化,并允许将模型行为从顶层表示追溯至模型极细粒度的部分。具体而言,它 (1) 展示了从输入到输出的整个信息流的重要部分,(2) 允许将模型块所做的任何变化归因于单个注意力头和前馈神经元,(3) 允许解释这些头或神经元的功能。该流程的关键部分是在每一步展示特定模型组件的重要性。因此,我们能够仅在模型组件对预测具有重要影响的情况下才审视其作用。由于了解应检查哪些组件对于分析组件数量极多的大型模型至关重要,我们相信我们的工具将在研究环境和实际应用中极大地支持可解释性社区。
引用
@article{arxiv.2404.07004,
title = {LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models},
author = {Igor Tufanov and Karen Hambardzumyan and Javier Ferrando and Elena Voita},
journal= {arXiv preprint arXiv:2404.07004},
year = {2024}
}