中文

语言多样性:评估数字空间中非洲语言的使用与AI性能

计算与语言 2026-01-27 v2

摘要

本研究考察了非洲语言的数字表征及其对当前语言检测工具带来的挑战。我们评估了这些工具在约鲁巴语、基尼亚鲁旺达语和阿姆哈拉语上的性能。尽管这些语言有数百万使用者,但它们在对话平台上的在线使用往往稀少,严重受英语影响,且不能代表母语者之间普遍存在的真实单语对话。缺乏易于获取的真实性在线数据,为训练语言模型带来了对话数据稀缺的挑战。为对此进行探究,我们从各语言的subreddit和本地新闻来源收集了数据。分析显示两类来源之间存在显著差异。Reddit数据极少,且以大量语码转换(code-switching)为特征。相反,本地新闻媒体提供了丰富的干净单语语言数据,这也促使用户在新闻发布者的社交媒体页面上更多地使用本地语言。语言检测模型,包括专门的AfroLID和通用LLM,在干净的新闻数据上表现接近完美,但在语码转换的Reddit帖子上则表现不佳。研究结论认为,专业策划的新闻内容是训练非洲语言上下文丰富的AI模型比对话平台数据更可靠、更有效的来源。它还强调了未来模型需要能够处理干净文本和语码转换文本,以提升非洲语言的检测准确率。

关键词

引用

@article{arxiv.2512.01557,
  title  = {Language Diversity: Evaluating Language Usage and AI Performance on African Languages in Digital Spaces},
  author = {Edward Ajayi and Eudoxie Umwari and Mawuli Deku and Prosper Singadi and Jules Udahemuka and Bekalu Tadele and Chukuemeka Edeh},
  journal= {arXiv preprint arXiv:2512.01557},
  year   = {2026}
}