CATT:基于字符的阿拉伯语标音 Transformer
计算与语言
2024-07-16 v3
摘要
Tashkeel,即阿拉伯语文本标音化(ATD),通过消除歧义和最大限度地减少因其缺失而导致的误解风险,极大地增强了对阿拉伯语文本的理解。它在改进阿拉伯语文本处理方面发挥着关键作用,特别是在文本转语音和机器翻译等应用中。本文介绍了一种训练 ATD 模型的新方法。首先,我们微调了两个 Transformer 模型(仅编码器和编码器-解码器),它们均由预训练的基于字符的 BERT 初始化。然后,我们应用 Noisy-Student 方法以提升最佳模型的性能。我们使用两个手动标注的基准数据集:WikiNews 和我们的 CATT 数据集,将我们的模型与 11 个商业和开源模型进行了评估。研究结果表明,我们的顶级模型在 WikiNews 和 CATT 上的相对标音错误率(DER)分别比所有被评估模型低 30.83% 和 35.21%,在 ATD 领域达到了 SOTA。此外,我们展示了我们的模型在 CATT 数据集上以 9.36% 的相对 DER 优于 GPT-4-turbo。我们为研究社区开源了我们的 CATT 模型和基准数据集\footnote{https://github.com/abjadai/catt}。
引用
@article{arxiv.2407.03236,
title = {CATT: Character-based Arabic Tashkeel Transformer},
author = {Faris Alasmary and Orjuwan Zaafarani and Ahmad Ghannam},
journal= {arXiv preprint arXiv:2407.03236},
year = {2024}
}