语义还是拼写?利用正字法噪声探测上下文词嵌入
计算与语言
2024-08-09 v1
摘要
预训练语言模型(PLM)的隐藏状态常被用作上下文词嵌入(CWE):在给定语言上下文中编码语义信息的高维表示。在计算语言学的许多研究领域,CWE之间的相似性被解释为语义相似性。然而,PLM隐藏状态中究竟编码了什么信息仍不清楚。我们通过使用最小正字法噪声来探测PLM表示,以研究这一做法。我们预期,如果CWE主要编码语义信息,那么输入词中的单个字符交换不会显著影响所产生的表示,前提是有足够的语言上下文。令人惊讶的是,我们发现流行PLM生成的CWE对输入数据中的噪声高度敏感,并且这种敏感性与子词分词有关:用于表示一个词的token越少,其对应的CWE就越敏感。这表明CWE捕获了与词级含义无关的信息,并且可以通过对输入数据的平凡修改来操纵。我们得出结论,这些PLM衍生的CWE可能不是可靠的语义代理,并且在解释表示相似性时需要谨慎。
引用
@article{arxiv.2408.04162,
title = {Semantics or spelling? Probing contextual word embeddings with orthographic noise},
author = {Jacob A. Matthews and John R. Starr and Marten van Schijndel},
journal= {arXiv preprint arXiv:2408.04162},
year = {2024}
}