AfroScope:研究非洲语言景观的框架
计算与语言
2026-01-30 v2
摘要
语言识别(LID)是确定给定文本语言的任务,也是影响下游 NLP 应用可靠性的基本预处理步骤。尽管近期工作扩展了非洲语言的 LID 覆盖范围,但现有方法在以下两方面仍受限制: 支持的语言数量; 对密切相关的语言变体进行细粒度区分的能力。我们引入 AfroScope,一个面向非洲 LID 的统一框架,包含 AfroScope-Data(一个覆盖 713 种非洲语言的数据集)和 AfroScope-Models(一套具有广泛语言覆盖的强大 LID 模型)。为了更好地区分高度易混淆的语言,我们提出了一种层次分类方法,该方法利用了 Mirror-Serengeti——一个针对 29 种密切相关或地理相近语言的专用嵌入模型。与最佳基础模型相比,该方法在此易混淆子集上的 macro F1 提高了 4.55。最后,我们分析了跨语言迁移与领域效应,为构建稳健的非洲 LID 系统提供了指导。我们将非洲 LID 定位为在数字文本中大规模测量非洲语言景观的赋能技术,并公开发布 AfroScope-Data 和 AfroScope-Models。
引用
@article{arxiv.2601.13346,
title = {AfroScope: A Framework for Studying the Linguistic Landscape of Africa},
author = {Sang Yun Kwon and AbdelRahim Elmadany and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2601.13346},
year = {2026}
}