条条大路通罗马?探索 Transformer 表征的不变性
计算与语言
2023-05-25 v1 人工智能
机器学习
摘要
Transformer 模型在各种 NLP 任务中带来了令人振奋的进展,从而引发了大量关于模型所学表征的可解释性研究。然而,我们提出一个关于表征可靠性的基本问题。具体而言,我们研究 Transformer 是否学习了本质同构的表征空间,还是那些对其预训练过程中的随机种子敏感的表征空间。在本工作中,我们提出双射假设(Bijection Hypothesis),主张使用双射方法对齐不同模型的表征空间。我们提出一种基于可逆神经网络的模型 BERT-INN,相比其他现有双射方法(如典型相关分析(CCA))能更有效地学习双射。我们从理论上并通过大量实验展示了 BERT-INN 的优势,并将其应用于对齐复现的 BERT 嵌入,以得出对可解释性研究有意义的见解。我们的代码位于 https://github.com/twinkle0331/BERT-similarity。
引用
@article{arxiv.2305.14555,
title = {All Roads Lead to Rome? Exploring the Invariance of Transformers' Representations},
author = {Yuxin Ren and Qipeng Guo and Zhijing Jin and Shauli Ravfogel and Mrinmaya Sachan and Bernhard Schölkopf and Ryan Cotterell},
journal= {arXiv preprint arXiv:2305.14555},
year = {2023}
}