UnifiedCrawl:聚合通用爬虫数据以低成本适配低资源语言大语言模型
计算与语言
2024-11-22 v1 人工智能
摘要
大语言模型(LLM)在低资源语言上表现不佳,原因是训练数据有限。我们提出了一种从整个Common Crawl语料库中高效收集低资源语言文本数据的方法。我们的方法UnifiedCrawl使用最少的计算资源过滤和提取通用爬虫数据,生成比以往可用来源大得多的单语数据集。我们证明,利用这些数据通过高效适配器方法(QLoRA)微调多语言LLM,能显著提升低资源语言上的性能,同时最大限度地减少VRAM占用。实验结果显示,语言建模困惑度大幅降低,少样本提示得分有所提高。我们的工作和发布的源代码提供了一种在消费级硬件上改进低资源语言LLM的经济实惠的方法。我们的源代码可在 https://github.com/bethelmelesse/unifiedcrawl 获取。
引用
@article{arxiv.2411.14343,
title = {UnifiedCrawl: Aggregated Common Crawl for Affordable Adaptation of LLMs on Low-Resource Languages},
author = {Bethel Melesse Tessema and Akhil Kedia and Tae-Sun Chung},
journal= {arXiv preprint arXiv:2411.14343},
year = {2024}
}