利用子词表示学习与位置感知自注意力增强信德语分词
计算与语言
2024-09-05 v2 机器学习
摘要
由于空格省略与插入问题,信德语分词是一项具有挑战性的任务。信德语本身增加了这种复杂性:它是草书字体,由具有固有连写与非连写属性的字符组成,且与词边界无关。现有的信德语分词方法依赖于设计和组合手工特征。然而,这些方法存在局限,例如难以处理词汇表外词、对其他语言的鲁棒性有限,以及在处理大量含噪或原始文本时效率低下。相比之下,基于神经网络的模型能够自动捕获词边界信息而无需先验知识。本文提出一种子词引导的神经分词器(SGNWS),将分词作为序列标注任务来处理。SGNWS模型通过双向长短期记忆编码器、位置感知自注意力以及条件随机场来融入子词表示学习。我们的实证结果表明,SGNWS模型在六个数据集上的信德语分词中达到了最先进(state-of-the-art)性能。
引用
@article{arxiv.2012.15079,
title = {Enhancing Sindhi Word Segmentation using Subword Representation Learning and Position-aware Self-attention},
author = {Wazir Ali and Jay Kumar and Saifullah Tumrani and Redhwan Nour and Adeeb Noor and Zenglin Xu},
journal= {arXiv preprint arXiv:2012.15079},
year = {2024}
}
备注
Journal Paper, 14 pages