打破字符:子词对于形态丰富语言而言究竟足够吗?
计算与语言
2022-04-12 v1
摘要
大型预训练语言模型(PLM)通常在任何预训练或推理之前将输入字符串切分为连续的子词。然而,先前的研究声称这种子词切分形式不足以处理形态丰富语言(MRL)。我们通过预训练一个BERT风格的掩码语言模型来处理字符序列而非词片,重新审视这一假设。我们将所得模型称为TavBERT,并针对三种高度复杂且歧义性强的MRL(希伯来语、土耳其语和阿拉伯语),在形态学和语义任务上将其与基于子词的当代PLM进行比较。我们的结果表明,对于所有测试语言,虽然TavBERT在词性标注和完整形态消歧等表层任务上获得轻微提升,但基于子词的PLM在命名实体识别和抽取式问答等语义任务上取得了显著更高的性能。这些结果展示并(重新)确认了子词切分作为许多语言(包括MRL)合理建模假设的潜力。
引用
@article{arxiv.2204.04748,
title = {Breaking Character: Are Subwords Good Enough for MRLs After All?},
author = {Omri Keren and Tal Avinari and Reut Tsarfaty and Omer Levy},
journal= {arXiv preprint arXiv:2204.04748},
year = {2022}
}