中文

真实环境中的语言识别:通向千种语言网络文本语料库之路的意外挑战

计算与语言 2020-10-30 v2 机器学习

摘要

大型文本语料库对于广泛的自然语言处理 (NLP) 任务日益重要,而自动语言识别 (LangID) 是在多语言背景下收集此类数据集所需的核心技术。在文献中,LangID 在很大程度上被视为已解决的问题,报告的模型在多达 1,366 种语言上的平均 F1 值超过 90%。我们在多达 1,629 种语言上训练了 LangID 模型,在保留测试集上取得了相当的质量,但发现对于使用这些模型创建的网络抓取文本语料库,许多低资源语言的人工判断 LangID 准确率仅约为 5%,这表明需要更稳健的评估。进一步分析揭示了多种错误模式,这些错误源于领域不匹配、类别不平衡、语言相似性以及模型表达能力不足。我们提出了两类技术来减轻这些错误:基于词表的可调精度过滤器(我们发布了约 500 种语言的精选词表)和基于 Transformer 的半监督 LangID 模型,该模型将数据集中位数精度从 5.5% 提高到 71.2%。这些技术使我们能够创建一个初始数据集,涵盖 500 多种语言中每种语言 10 万或更多相对干净的句子,为通向千种语言网络文本语料库铺平了道路。

关键词

引用

@article{arxiv.2010.14571,
  title  = {Language ID in the Wild: Unexpected Challenges on the Path to a Thousand-Language Web Text Corpus},
  author = {Isaac Caswell and Theresa Breiner and Daan van Esch and Ankur Bapna},
  journal= {arXiv preprint arXiv:2010.14571},
  year   = {2020}
}

备注

Accepted to COLING 2020. 9 pages with 8 page abstract