塞尔维亚语自然语言处理的资源与方法综述
计算与语言
2023-04-13 v1 数字图书馆
人机交互
摘要
塞尔维亚语是一种斯拉夫语言,由超过 1200 万使用者使用,并被超过 1500 万人良好理解。在自然语言处理领域,它可被视为低资源语言。此外,塞尔维亚语被认为是一种高屈折语言。大量词形变化与语言资源低可用性的结合使得塞尔维亚语的自然语言处理具有挑战性。然而,在过去三十年中,已有若干倡议致力于开发塞尔维亚语自然语言处理的资源与方法,从开发来自书籍和互联网的自由文本语料库、用于分类与命名实体识别任务的标注语料库,到执行这些任务的各种方法与模型。在本文中,我们回顾这些倡议、资源、方法及其可用性。
引用
@article{arxiv.2304.05468,
title = {A Survey of Resources and Methods for Natural Language Processing of Serbian Language},
author = {Ulfeta A. Marovac and Aldina R. Avdić and Nikola Lj. Milošević},
journal= {arXiv preprint arXiv:2304.05468},
year = {2023}
}
备注
43 pages, submitted to Artificial Intelligence Review Journal