中文

KyrgyzNLP: 挑战、进展与未来

计算与语言 2024-11-19 v2

摘要

大型语言模型(LLMs)在诸多基准测试中表现卓越,推动了AI在语言和非语言任务中的应用。然而,这主要受益于资源丰富的语言,给资源匮乏的语言(LRLs)留下了劣势。本文聚焦于特定的LRL:吉尔吉z语言。人类评估,包括由母语者创建的注释数据集,是可靠NLP性能中不可或缺的组成部分,尤其是对于资源匮乏的语言,自动评估往往不足。在最近的突尼克语资源评估中,吉尔吉z被标记为“仅存”,是一类资源极度匮乏的语言,拥有数百万使用者。这一现象令人关切,因为该语言不仅在吉尔吉z坦共和国重要,而且在非官方地位的海外社区中也具有重要意义。我们回顾了该领域的既有工作,指出许多公开资源仅近期才开发,除字典外鲜有例外(用于分析的数据可在https://kyrgyznlp.github.io/上获取)。尽管近期论文取得了一些进展,但仍需付诸行动。尽管吉尔吉z坦共和国的企业和政府部门对该语言表现出浓厚兴趣和支持,但该语言资源的现状仍然具有挑战性。我们强调了社区驱动的构建这些资源的重要性,以确保未来发展的可持续性。我们 then 分享了对吉尔吉z NLP最紧迫挑战的看法。最后,我们提出了未来发展的路线图,包括研究主题和语言资源。

关键词

引用

@article{arxiv.2411.05503,
  title  = {KyrgyzNLP: Challenges, Progress, and Future},
  author = {Anton Alekseev and Timur Turatali},
  journal= {arXiv preprint arXiv:2411.05503},
  year   = {2024}
}

备注

Keynote talk at the 12th International Conference on Analysis of Images, Social Networks and Texts (AIST-2024)