Typoglycemia 现象剖析:探究语言模型对乱序单词的理解
计算与语言
2025-10-27 v1
摘要
语言学研究表明,人类能够阅读包含内部乱序字母的单词,一种被称为typoglycemia的现象。最近,有些特定的NLP模型被提出,设计上能够对此类扰动表现出鲁棒性,通过忽略字符的内部顺序。这引出了一个根本性问题:当许多不同单词(例如form和from)在typoglycemia下折叠为相同表征时,模型如何表现良好?本文专注于英语语言,旨在阐明这种鲁棒性背后的关键因素。我们假设主要原因有两个:(i)相对少数的英语单词在typoglycemia下发生折叠;(ii)折叠后的单词在语境中相当distinct,以至于消歧变得微不足道。在我们的分析中,我们(i)分析英国国家语料库以量化typoglycemia下的单词折叠与歧义;(ii)评估BERT对折叠形式的消歧能力;(iii)通过比较在干净文本与typoglycemic维基百科文本上从头训练的BERT变体,进行探针实验;我们的结果显示,扰动导致的性能下降小于人们预期。
引用
@article{arxiv.2510.21326,
title = {Typoglycemia under the Hood: Investigating Language Models' Understanding of Scrambled Words},
author = {Gianluca Sperduti and Alejandro Moreo},
journal= {arXiv preprint arXiv:2510.21326},
year = {2025}
}