在 Sesame Street 上摇动句法树:基于可控扰动的多语言探测
计算与语言
2023-10-04 v1
摘要
近期的研究围绕文本扰动的概念展开了一个新的实验领域,研究表明,打乱的词序对基于 Transformer 的语言模型在许多 NLP 任务上的下游性能几乎没有影响。这些发现与关于模型如何编码层级和结构信息的普遍认知相矛盾,甚至质疑了词序是否通过位置嵌入进行建模。为此,本文针对三种具有不同程度词序灵活性的印欧语系语言——英语、瑞典语和俄语,按可控文本扰动的类型提出了九个探测数据集。基于对 M-BERT 和 M-BART 模型的探测分析,我们报告句法敏感性取决于语言和模型预训练目标。我们还发现,敏感性在各层中随着扰动粒度的增加而增长。最后但同样重要的是,我们表明模型几乎不使用位置信息来从其中间自注意力和上下文化表示中归纳句法树。
引用
@article{arxiv.2109.14017,
title = {Shaking Syntactic Trees on the Sesame Street: Multilingual Probing with Controllable Perturbations},
author = {Ekaterina Taktasheva and Vladislav Mikhailov and Ekaterina Artemova},
journal= {arXiv preprint arXiv:2109.14017},
year = {2023}
}
备注
accepted to MRL @ EMNLP 2021