OpenLID-v3:提高紧密相关语言识别精度——经验报告
计算与语言
2026-02-24 v2
摘要
语言识别(LID)是构建高质量多语言数据集的关键步骤。现有LID工具(如OpenLID或GlotLID)常在识别紧密相关语言方面困难,且难以区分有效自然语言与噪声,尤其影响低资源语言。本文我们通过增加训练数据、合并问题性语言变体聚类,并引入标记噪声的特殊标签来扩展OpenLID分类器。我们称其为OpenLID-v3,并在多个基准上对其进行评估。开发期间,我们聚焦三个紧密相关语言群体(波斯尼亚语、克罗地亚语和塞尔维亚语;意大利北部和法国南部的罗曼语变体;斯堪的纳维亚语),并贡献新的评估数据集以弥补现有数据集的不足。我们发现集成方法可提高精度,但也显著降低了低资源语言的覆盖率。OpenLID-v3已在https://huggingface.co/HPLT/OpenLID-v3上提供。
引用
@article{arxiv.2602.13139,
title = {OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report},
author = {Mariia Fedorova and Nikolay Arefyev and Maja Buljan and Jindřich Helcl and Stephan Oepen and Egil Rønningstad and Yves Scherrer},
journal= {arXiv preprint arXiv:2602.13139},
year = {2026}
}
备注
VarDial'26 workshop at the EACL 2026 conference