面向库尔德语自然语言处理任务的全面词性标注:标准化中叙库尔德语的研究指南
计算与语言
2025-04-29 v1 人工智能
摘要
自然语言处理 (NLP) 领域在过去十年里发生了巨大发展。许多日常人类应用通过 NLP 任务进行日常操作,包括机器翻译、语音识别、文本生成和推荐系统,以及词性标注 (POS) 和命名实体识别 (NER)。然而,由于缺乏必要资源支持,诸如中叙库尔德语 (CKL) 等低资源语言主要未被考察。POS 标注是其他 NLP 任务的基础;例如,POS 标签集合被用于标准化语言,提供句子之间单词的关系,随后用于机器翻译和文本推荐。具体而言,对于 CKL 来说,大多数所利用或提供的 POS 标签集合既不标准化也不完整。为此,本研究提出了用于中叙库尔德语的准确且全面的 POS 标签集合,以提高库尔德语 NLP 任务的性能。本文还收集了来自不同研究以及来自库尔德语言专家的大多数 POS 标签,以标准化词性标签。该提议的 POS 标签集合设计用于注释中叙库尔德语的大型语料库,并支持库尔德语 NLP 任务。本研究的初始调查通过与通用依赖框架 (Universal Dependencies) 进行标准化语言的比较,表明所提议的 POS 标签集合能够更准确地简化或纠正中叙库尔德语的句子,以适用于 NLP 任务。
引用
@article{arxiv.2504.19645,
title = {A Comprehensive Part-of-Speech Tagging to Standardize Central-Kurdish Language: A Research Guide for Kurdish Natural Language Processing Tasks},
author = {Shadan Shukr Sabr and Nazira Sabr Mustafa and Talar Sabah Omar and Salah Hwayyiz Rasool and Nawzad Anwer Omer and Darya Sabir Hamad and Hemin Abdulhameed Shams and Omer Mahmood Kareem and Rozhan Noori Abdullah and Khabat Atar Abdullah and Mahabad Azad Mohammad and Haneen Al-Raghefy and Safar M. Asaad and Sara Jamal Mohammed and Twana Saeed Ali and Fazil Shawrow and Halgurd S. Maghdid},
journal= {arXiv preprint arXiv:2504.19645},
year = {2025}
}
备注
25 pages, 4 figures, 2 tables