针对日语小型语言模型的方法适配:规模、架构与量化
机器学习
2026-03-20 v1
摘要
本文提出了一种系统性的方法,用于构建基于QLoRA微调的领域特定日语小型语言模型。我们回答了三个核心问题:最佳训练规模、基座模型选择和架构感知量化。阶段1(训练规模):规模学习实验(1k--5k样本)识别出n=4,000为最佳值,在此处测试集负对数似然达到最小值(1.127),随后在5k样本处出现过拟合。阶段2(比较微调的小型语言模型):比较四个日语大语言模型显示,搭载日语持续预训练(Swallow-8B、ELYZA-JP-8B)的Llama-3模型优于多语言模型(Qwen2.5-7B)。阶段3(量化):Llama-3架构在Q4_K_M量化下表现提升,而GQA架构则严重下降(Qwen2.5:-0.280分)。生产建议:Swallow-8B Q4_K_M实现2.830/3的得分,8.9秒/问题,4.9 GB大小。该方法论对低资源技术领域具有普适性,为在消费级硬件上构建紧凑型日语专家语言模型提供了可操作指导。
引用
@article{arxiv.2603.18037,
title = {Adapting Methods for Domain-Specific Japanese Small LMs: Scale, Architecture, and Quantization},
author = {Takato Yasuno},
journal= {arXiv preprint arXiv:2603.18037},
year = {2026}
}
备注
16 pages, 11 figures, 6 tables