一种用于部分变音符号化的上下文对比推理方法
计算与语言
2024-08-12 v3 机器学习
摘要
变音符号化在提高阿拉伯语文本的可读性和消除歧义方面起着关键作用。迄今为止的努力主要集中在标记每个符合条件的字符(全变音符号化)。相对被忽视的部分变音符号化(PD)是选择一部分字符进行标记,以便在需要时辅助理解。研究表明,过多的变音符号标记会阻碍熟练的阅读者——降低阅读速度和准确性。我们进行了一项行为实验,并表明部分标记的文本通常比完全标记的文本更容易阅读,有时甚至比纯文本更容易。鉴于此,我们引入了上下文对比部分变音符号化(CCPD)——一种与现有阿拉伯语变音符号化系统无缝集成的新颖 PD 方法。CCPD 对每个词处理两次,一次有上下文,一次没有,并且只对两次推断之间存在差异的字符进行变音符号化。此外,我们引入了用于衡量部分变音符号化质量的新颖指标,这对于将其确立为一项机器学习任务至关重要。最后,我们引入了 TD2,这是一个已建立模型的 Transformer 变体,在我们提出的指标上,与所有其他已知系统相比,它提供了显著不同的性能特征。
引用
@article{arxiv.2401.08919,
title = {A Context-Contrastive Inference Approach To Partial Diacritization},
author = {Muhammad ElNokrashy and Badr AlKhamissi},
journal= {arXiv preprint arXiv:2401.08919},
year = {2024}
}
备注
14 equations, 5 tables, 5 figures