语境化影响NLP任务的语言资源丰度层级
计算与语言
2026-01-21 v2
摘要
若干广泛使用的软件应用涉及某种形式的自然语言处理,任务范围从硬拷贝数字化和文本处理到语音生成。开发软件系统以完成广泛的NLP(natural language processing,自然语言处理)任务(如无处不在的拼写检查器和聊天机器人)时,会使用多样的语言资源。语言通常被表征为低资源语言(LRL)或高资源语言(HRL),非洲语言一直被表征为资源稀缺语言,而英语迄今为止是资源最丰富的语言。但两者之间的情况如何?我们认为,对所有语言采用LRL与HRL的二分类型学是有问题的。通过对社会中语言资源的清晰理解,我们开发了一个矩阵,将语言表征为极低资源、低资源、中资源、高资源和极高资源。该表征基于每一类别的语境特征类型学,而非工具计数。我们为每一特征和每一表征提供了动机说明。本文以非洲语言为重点的资源丰度语境化,以及对项目中使用的语言在量表上所处位置增进的理解,可有助于(其中包括)更好地规划研究与实施项目。因此我们本文主张,项目中给定量表内的语言资源表征是一个不可或缺的组成部分,尤其对于处于量表下半部分的语言。
引用
@article{arxiv.2309.17035,
title = {Contextualising Levels of Language Resourcedness that affect NLP tasks},
author = {C. Maria Keet and Langa Khumalo},
journal= {arXiv preprint arXiv:2309.17035},
year = {2026}
}
备注
27 pages, 2 tables