为低资源语言引入音节分词:以斯瓦希里语为案例研究
计算与语言
2024-06-25 v1
摘要
在多语言自然语言处理中,已有多种尝试以确保预训练语言模型(如 mBERT 或 GPT2)获得更好的性能并适用于低资源语言。为实现预训练语言模型(PLMs)的多语言性,我们需要创建能够捕捉任何语言语言特征的词嵌入的技术。分词是一种此类技术,因为它允许根据字符或子词将单词拆分,从而创建能够最好表示语言结构的词嵌入。创建此类词嵌入对于将 PLMs 应用于模型未训练的语言至关重要,以实现跨语言的 NLP。然而,大多数 PLMs 使用通用分词方法,如 BPE、wordpiece 或 unigram,这些方法可能不适合特定语言。我们假设,基于输入文本中音节的分词,即我们称之为音节分词的分词,应该促进开发面向音节的语言模型。面向音节的语言模型使得将 PLMs 应用于富含音节的语言(例如斯瓦希里语)成为可能。以前的工作引入了子词分词。我们的工作延续了此类努力。值得注意的是,我们提出了一种音节分词器,并采用以斯瓦希里语为案例的实验方法来验证所提出的分词器。我们使用 GPT2 进行文本生成实验,以评估音节分词器的效果。我们的结果表明,所提出的音节分词器生成的音节嵌入能够有效地表示斯瓦希里语。
引用
@article{arxiv.2406.15358,
title = {Introducing Syllable Tokenization for Low-resource Languages: A Case Study with Swahili},
author = {Jesse Atuhurra and Hiroyuki Shindo and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2406.15358},
year = {2024}
}