开发并利用大规模粤语数据集以增强大语言模型的多任务能力
计算与语言
2025-03-06 v1
摘要
高质量数据资源在学习大语言模型(LLM)中起着至关重要的作用,尤其是对于粤语这类低资源语言。尽管粤语拥有超过8500万母语使用者,但由于普通话的主导地位、粤语社群内部缺乏凝聚力、字符编码和输入方式的多样性,以及海外粤语使用者倾向于使用英语等因素,粤语在自然语言处理(NLP)领域仍被视为低资源语言。此外,粤语丰富的口语词汇、英语借词以及语码转换特征也增加了语料收集和处理的复杂性。为应对这些挑战,我们从多种来源收集粤语文本,包括开源语料库、香港特定论坛、维基百科和Common Crawl数据。通过语言过滤、质量过滤、内容过滤和去重等严格的数据处理步骤,我们成功构建了一个超过20亿token的高质量粤语语料库,用于训练大语言模型。我们进一步通过精心策划的粤语任务上的监督微调(SFT)来优化模型,增强其处理特定应用的能力。训练完成后,该模型在四项粤语基准测试上达到了最先进的(SOTA)性能。在我们的数据集上训练后,该模型在其他主流语言任务上也表现出提升的性能。
引用
@article{arxiv.2503.03702,
title = {Developing and Utilizing a Large-Scale Cantonese Dataset for Multi-Tasking in Large Language Models},
author = {Jiyue Jiang and Alfred Kar Yin Truong and Yanyu Chen and Qinghang Bao and Sheng Wang and Pengan Chen and Jiuming Wang and Lingpeng Kong and Yu Li and Chuan Wu},
journal= {arXiv preprint arXiv:2503.03702},
year = {2025}
}