以奥卡姆剃刀审视基于 Transformer 的依存句法分析:何者有效、何者无效、何者真正必要
计算与语言
2021-07-30 v3
摘要
预训练的基于 transformer 的上下文词嵌入的引入,显著提升了针对通用依存(UD)等框架的基于图的解析器的准确率。然而,先前工作在多个维度上存在差异,包括预训练语言模型的选择以及是否使用 LSTM 层。为厘清这些选择的影响并识别一种简单且广泛适用的架构,我们提出了 STEPS,一种新型模块化基于图的依存解析器。利用 STEPS,我们对一组多样化语言的 UD 语料库进行了一系列分析。我们发现,预训练嵌入的选择对解析器性能的影响远超其他因素,并确定 XLM-R 为本研究中跨语言稳健的选择。使用基于 transformer 的嵌入时,添加 LSTM 层并无益处。输出额外 UD 特征的多任务训练设置可能扭曲结果。综合这些发现,我们提出了一种简单但广泛适用的解析器架构与配置,在 12 种多样化语言中的 10 种上取得了新的最先进结果(以 LAS 计)。
引用
@article{arxiv.2010.12699,
title = {Applying Occam's Razor to Transformer-Based Dependency Parsing: What Works, What Doesn't, and What is Really Necessary},
author = {Stefan Grünewald and Annemarie Friedrich and Jonas Kuhn},
journal= {arXiv preprint arXiv:2010.12699},
year = {2021}
}
备注
14 pages, 1 figure; camera-ready version for IWPT 2021