CUTE:用于增强低资源语言跨语言知识迁移的多语言数据集
计算与语言
2025-09-23 v1
摘要
大型语言模型(LLMs)在various NLP tasks中展现出卓越的零样例能力,显著提升用户体验和效率。然而,这一优势主要局限于资源丰富的语言。对于多样化的低资源语言,支持仍不足,数据稀缺被视为主要原因。我们构建并开源CUTE Chinese、Uyghur、Tibetan、English数据集,包含两个25GB的四语言语料集合(一个平行语料库和一个非平行语料库),通过机器翻译获得。CUTE涵盖两个资源丰富的语言(中文和英文)和两个低资源语言(维吾尔语和藏语)。在构建CUTE之前,人类评估表明,中文-维吾尔语和中文-藏语之间的机器翻译质量相当于中文-英文翻译。CUTE目前是维吾尔语和藏语最大的开放语料库,我们证明其在增强LLMs处理低资源语言能力方面的有效性,并探讨语料库平行度在跨语言迁移学习中的作用。CUTE语料库及相关模型已公开供研究社区使用。
引用
@article{arxiv.2509.16914,
title = {CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages},
author = {Wenhao Zhuang and Yuan Sun},
journal= {arXiv preprint arXiv:2509.16914},
year = {2025}
}