TransLIST:一种基于 Transformer 且融入语言知识的梵文分词器
计算与语言
2022-10-24 v1
摘要
梵文分词(Sanskrit Word Segmentation, SWS)对于使数字化文本可用以及部署下游任务至关重要。然而,由于 sandhi 现象会修改词边界处的字符,它需要特殊处理,因此并非易事。现有的词典驱动 SWS 方法利用 Sanskrit Heritage Reader(一种词典驱动的浅层分析器)生成完整的候选解空间,并在其上应用各种方法以产生最有效的解。然而,这些方法在遇到词表外(out-of-vocabulary)词元时会失效。另一方面,纯粹的 SWS 工程方法利用了深度学习的近期进展,但无法在可用时利用潜在词信息。为缓解两类方法的缺陷,我们提出基于 Transformer 且融入语言知识的梵文分词器(Transformer based Linguistically Informed Sanskrit Tokenizer, TransLIST),其包含(1)一个对字符输入及潜在词信息进行编码的模块,该模块考虑了 SWS 特有的 sandhi 现象,并适用于部分或无候选解的情形;(2)一种用于优先处理潜在候选词的新型软掩码注意力(soft-masked attention);(3)一种用于纠正损坏预测的新型路径排序算法。在 SWS 基准数据集上的实验表明,TransLIST 在完美匹配(perfect match, PM)指标上以平均 7.2 个绝对点的提升优于当前最先进(state-of-the-art)系统。代码库与数据集公开于 https://github.com/rsingha108/TransLIST
引用
@article{arxiv.2210.11753,
title = {TransLIST: A Transformer-Based Linguistically Informed Sanskrit Tokenizer},
author = {Jivnesh Sandhan and Rathin Singha and Narein Rao and Suvendu Samanta and Laxmidhar Behera and Pawan Goyal},
journal= {arXiv preprint arXiv:2210.11753},
year = {2022}
}
备注
Accepted at EMNLP22 (Findings)