单块消费级 GPU 上纯传统中文 LLaMA-1B 的高效训练: 持续预训练、SFT 与 DPO
计算与语言
2025-10-03 v1
摘要
小型语言模型(SLMs)使成本效益高、可部署于设备端且具有延迟敏感性的 AI 应用成为可能, 但其在传统中文(TC) 的部署仍受限于词汇水平不稳定性 - 模型不可预测地输出非 TC 字符或语言切换. 我们通过三阶段稳定化管道解决此实际可靠性差距, 使用 LoRA 参数高效适配器对 Llama-3.2-1B-Instruct(由 Meta 发布的开放权重指令调优模型)进行训练, 构建 PureTC-1B. 该方法组合持续预训练(CPT)于 TC 主题语料、基于指令数据的监督微调(SFT)以及使用 TC 遵循偏好进行直接偏好优化(DPO), 在不进行完整模型再训练的情况下提升单一语言可靠性. 在模拟真实使用情景的基准测试上, PureTC-1B 相较于基础模型在非 TC 输出词汇上实现了 51.3% 的相对减少(微平均). 在命名实体翻译(NET)任务中, PureTC-1B 相较于 Llama-3B 和 Qwen-1.5B 分别减少了 77.2% 和 57.2% 的错误语言词汇, 说明即使在 1B 规模下也可实现稳健的 TC 遵循. 该管道可复现、仅使用适配器且硬件友好, 为 TC 及其他非英文语言提供提升语言稳定性的实用配方.
引用
@article{arxiv.2510.01616,
title = {Efficient Training of Robust Traditional Chinese LLaMA-1B on a Single Consumer GPU: Continual Pre-training, SFT, and DPO},
author = {Yu-Cheng Chih and Ming-Tao Duan and Yong-Hao Hou},
journal= {arXiv preprint arXiv:2510.01616},
year = {2025}
}
备注
17 pages, 1 figures, 2 tables. Technical report. Introduces PureTC-1B, an adapter-based pipeline for stabilizing Small Language Models in Traditional Chinese using CPT, SFT, and DPO