QQ:面向语言标识符和元数据的工具包
计算与语言
2026-03-03 v1
摘要
多语言自然语言处理中所考虑的语言数量不断增加,包括新的数据集和任务,这带来了关于正确和准确报告所用语言以及如何使用的挑战。例如,数据集常常使用不同的语言标识符;有的使用 BCP-47(如 en_Latn),有的使用 ISO 639-1(en),更深入语言学的数据集使用 Glottocodes(stan1293)。对于几十种语言的标识符之间的映射是可管理的,但在处理数千种语言时变得不可扩展。我们介绍 QwanQwa,一个轻量级 Python 工具包,用于统一的语言元数据管理。QQ 将多种语言资源集成到单一接口中,提供便利的规范化和语言标识符之间的映射,并提供基于图的结构,使其能够穿越家族、地区、书写系统及其他语言属性。QQ既是(1)多语言 NLP 研究中简单的“胶水”库,使处理多种语言更加方便,也是(2)用于探索语言的直观方式,例如通过共享脚本、地区或其他元数据查找相关语言。
引用
@article{arxiv.2603.00620,
title = {QQ: A Toolkit for Language Identifiers and Metadata},
author = {Wessel Poelman and Yiyi Chen and Miryam de Lhoneux},
journal= {arXiv preprint arXiv:2603.00620},
year = {2026}
}
备注
System Demo