你会说哪种语言?——询问你的分词器
计算与语言
2026-02-20 v1
摘要
语言识别(LID)是许多多语言自然语言处理管道的重要组成部分,其中用于语料库精选、训练数据分析和跨语言评估大型语言模型。尽管在高资源语言方面已实现接近完美的性能,但现有系统在低资源和密切相关语言环境中仍然脆弱。我们介绍 UniLID,这是一种基于 UnigramLM 分词算法的简单且高效的 LID 方法,利用其概率框架、参数估计技术和推理策略。在简短的解释中,我们学习语言条件的单gram 分布 over 一个共享的分词器词汇表,但将分词视为语言特定的现象。我们的表述是数据和计算高效的,支持无需重新训练即可增量添加新语言,并且可以自然地集成到现有的语言模型分词管道中。针对 fastText、GlotLID 和 CLD3 等广泛使用的基线进行的实证评估显示,UniLID 在标准基准测试中实现了具竞争力的性能,在低资源环境中显著提高了样本效率——以每语言仅 5 个标记样本即可超过 70% 的准确率——并在细粒度方言识别方面实现了大幅提升。
引用
@article{arxiv.2602.17655,
title = {What Language is This? Ask Your Tokenizer},
author = {Clara Meister and Ahmetcan Yavuz and Pietro Lesci and Tiago Pimentel},
journal= {arXiv preprint arXiv:2602.17655},
year = {2026}
}