印度语言的 Unicode 规范化与字位解析
计算与语言
2024-05-28 v2
摘要
印度语言的书写系统以正字音节(亦称复杂字位)作为独特的水平单元。这些语言的一个显著特征是这些复杂字位单元,其由辅音/辅音连写、元音附加符号和辅音附加符号组成,共同构成一种独特的语言。这些语言的基于 Unicode 的书写方案常常忽视这一语言特征,并使用连接符字符与字体解释器的复杂方案将词编码为 Unicode 字符的线性序列。由于这种用数十个 Unicode 字形书写数千种不同独特字形(复杂字位)的方式,存在导致词形错误的严重歧义。本文提出两个库:i) 一个用于规范化由印度语言基于 Unicode 的编码方案所引发的不一致性的规范化器;ii) 一个面向 Abugida 文本的字形解析器。它将词解构为视觉上独立的正字音节或复杂字位及其组成成分。我们提出的规范化器比先前使用的 IndicNLP 规范化器更高效、更有效。此外,我们的解析器与规范化器也适用于通用 Abugida 文本处理,因为它们在基于词的鲁棒实验与 NLP 实验中表现良好。本文报告了 7 种语言字母表的流程,并开发了用于集成更多字母表的框架。
引用
@article{arxiv.2306.01743,
title = {Unicode Normalization and Grapheme Parsing of Indic Languages},
author = {Nazmuddoha Ansary and Quazi Adibur Rahman Adib and Tahsin Reasat and Asif Shahriyar Sushmit and Ahmed Imtiaz Humayun and Sazia Mehnaz and Kanij Fatema and Mohammad Mamun Or Rashid and Farig Sadeque},
journal= {arXiv preprint arXiv:2306.01743},
year = {2024}
}
备注
Published at LREC-COLING 2024