基于字典学习的Transformer可视化:上下文嵌入作为Transformer因子的线性叠加
计算与语言
2023-04-05 v2 机器学习
摘要
Transformer网络自提出以来彻底改变了NLP表示学习。尽管已做出大量努力来解释Transformer中的表示,但人们广泛认识到我们的理解尚不充分。一个重要原因是缺乏足够的可视化工具用于详细分析。在本文中,我们提出使用字典学习将这些“黑箱”打开为Transformer因子的线性叠加。通过可视化,我们展示了Transformer因子所捕捉的层次化语义结构,例如词级多义消歧、句级模式形成以及长距离依赖。虽然其中一些模式印证了传统的先验语言学知识,其余则相对出乎意料,可能提供新的见解。我们希望该可视化工具能带来进一步的知识以及对Transformer网络如何运作的更好理解。代码可在 https://github.com/zeyuyun1/TransformerVis 获取。
引用
@article{arxiv.2103.15949,
title = {Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors},
author = {Zeyu Yun and Yubei Chen and Bruno A Olshausen and Yann LeCun},
journal= {arXiv preprint arXiv:2103.15949},
year = {2023}
}
备注
This paper is published at DeeLIO Workshop@NAACL 2021