若干非洲语言的正字法相似性度量评估
计算与语言
2016-08-11 v1
摘要
众所周知,自然语言接口以及诸如拼写检查器和以本人语言进行的 Web 搜索等工具在 ICT 中介交流中很有用。然而,南部非洲大多数语言资源不足。因此,如果通用的和少数语言特定的 NLP 工具能够跨语言复用或轻松适配,将非常有用。这取决于语言之间相似性的概念与程度。我们从正字法和语料库的角度评估这一点。考察了十二个版本的《世界人权宣言》(UDHR),展示了语言聚类,从而或多或少适于 NLP 工具的跨语言适配,但这与 Guthrie 区域并不匹配。为检验这些结果的泛化性,我们定量与定性地聚焦于 isiZulu 及其他四个不同体裁的语料库和文本。结果表明,UDHR 在正字法上是一个典型文本文档。结果还提供了对词汇多样性和体裁等典型度量可用性的见解,并且相同统计量在不同文档中可能意味着不同事物。虽然 Python 的 NLTK 可用于文本基本分析,但它及类似 NLP 工具将需要大量定制。
引用
@article{arxiv.1608.03065,
title = {An assessment of orthographic similarity measures for several African languages},
author = {C. Maria Keet},
journal= {arXiv preprint arXiv:1608.03065},
year = {2016}
}
备注
9 pages, 5 figures, 6 tables