基于塔吉克网络语料库的低资源塔吉克文本生成大语言模型参数高效微调基准测试
计算与语言
2026-05-06 v1
摘要
本文致力于为塔吉克语——一种使用西里尔字母的低资源语言——适配生成式大语言模型。为克服数字文本资源不足,作者创建并公开了塔吉克网络语料库(Tajik Web Corpus),这是目前最大的开放性塔吉克语语料库,包含 319,298 篇文档(约 111 亿字符)。在该语料库的 10,000 篇子样本上,对 17 种配置进行基准测试,涵盖自回归、编码器-解码器和编码器-only 模型,以及三种微调策略:全参数微调、LoRA 和 QLoRA(排名 8 和 16)。通过困惑度和交叉熵损失评估质量;同时记录峰值 GPU 内存和训练时间。最佳结果由 Mistral 7B 采用 QLoRA(r=16)实现:平均困惑度 5.03,标准差 0.03。排名从 8 提升至 16 虽无显著统计学提升,却增加了内存消耗。对于小型 GPT-2 系列模型,全参数微调获得更低困惑度(GPT-2 Medium 为 3.48),优于 LoRA(7.60-8.42),但导致灾难性遗忘。编码器-only 模型 XLM-RoBERTa 效果最差(困惑度 59.3)。本 work 的创新性在于构建最大的经验证的塔吉克语语料库,以及首次系统分析参数高效微调(PEFT)在塔吉克文本生成中的有效性。实际价值在于为模型架构和微调策略选择提供建议,在不显著牺牲质量的前提下优化计算成本。
引用
@article{arxiv.2605.03742,
title = {Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus},
author = {Mullosharaf K. Arabov},
journal= {arXiv preprint arXiv:2605.03742},
year = {2026}
}
备注
Preprint