中文

ViraPart:面向波斯语自动语音识别与自然语言处理任务的文本精炼框架

计算与语言 2021-11-23 v3

摘要

波斯语是一种屈折型主-宾-谓语言。这一事实使得波斯语成为一种不确定性更高的语言。然而,使用诸如零宽非连接符(ZWNJ)识别、标点恢复和波斯语 Ezafe 构建等技术,将引导我们获得一种更易理解且更精确的语言。在大多数针对波斯语的研究中,这些技术被单独处理。尽管如此,我们相信对于波斯语文本精炼而言,所有这些任务都是必要的。在这项工作中,我们提出了 ViraPart 框架,其核心使用内嵌的 ParsBERT 进行文本澄清。首先,使用针对波斯语的 BERT 变体,随后接一个分类器层用于分类过程。接下来,我们将模型输出组合以输出清晰文本。最终,所提出的用于 ZWNJ 识别、标点恢复和波斯语 Ezafe 构建的模型分别取得了 96.90%、92.13% 和 98.50% 的平均宏 F1 分数。实验结果表明,我们提出的方法在波斯语文本精炼方面非常有效。

关键词

引用

@article{arxiv.2110.09086,
  title  = {ViraPart: A Text Refinement Framework for Automatic Speech Recognition and Natural Language Processing Tasks in Persian},
  author = {Narges Farokhshad and Milad Molazadeh and Saman Jamalabbasi and Hamed Babaei Giglou and Saeed Bibak},
  journal= {arXiv preprint arXiv:2110.09086},
  year   = {2021}
}