雷声大雨点小:Transformer 语言模型中的无赖维度掩盖了表示质量
计算与语言
2021-09-10 v1 机器学习
摘要
相似性度量是理解语言模型如何表示和处理语言的重要工具。诸如余弦相似度和欧氏距离等标准表示相似性度量,已在静态词嵌入模型中成功用于理解词汇如何在语义空间中聚类。近期,这些度量已被应用于 BERT 和 GPT-2 等上下文模型的嵌入中。在这项工作中,我们对这些度量对于上下文语言模型的信息量提出质疑。我们发现少量无赖维度(通常仅 1-3 个)主导了这些度量。此外,我们发现主导相似性度量的维度与对模型行为至关重要的维度之间存在显著的不匹配。我们表明,标准化等简单的后处理技术能够校正无赖维度并揭示底层的表示质量。我们主张,在对上下文语言模型进行任何基于相似性的分析时,考虑无赖维度是必不可少的。
引用
@article{arxiv.2109.04404,
title = {All Bark and No Bite: Rogue Dimensions in Transformer Language Models Obscure Representational Quality},
author = {William Timkey and Marten van Schijndel},
journal= {arXiv preprint arXiv:2109.04404},
year = {2021}
}
备注
Accepted at EMNLP 2021