中文

地理信息驱动的语言识别

计算与语言 2024-03-18 v1

摘要

本文发展了一种语言识别方法,模型所考虑的语言集合取决于文本出现的地理来源。鉴于许多数字语料库可以按国家级别进行地理标记,本文构建了16个区域特定模型,每个模型包含该区域各国预期出现的语言。这些区域模型还包括31种广泛使用的国际语言,以确保无论位置如何都能覆盖这些通用语言。使用传统语言识别测试数据进行的上游评估显示,F值提升幅度从1.7分(东南亚)到最高可达10.4分(北非)。在社交媒体数据上的下游评估表明,这一改进性能够显著影响对大规模实际语料库所应用的语言标签。结果是一个覆盖916种语言、样本量为50个字符的高精度模型,通过将地理信息纳入模型中实现性能提升。

关键词

引用

@article{arxiv.2403.09892,
  title  = {Geographically-Informed Language Identification},
  author = {Jonathan Dunn and Lane Edwards-Brown},
  journal= {arXiv preprint arXiv:2403.09892},
  year   = {2024}
}