StatLLaMA:面向统计领域优化的多阶段训练统计大语言模型
计算与语言
2026-02-12 v2 人工智能
摘要
本研究探讨如何基于轻量级 LLaMA-3.2-3B 系列基础模型(FM),高效构建面向统计学的领域专用大语言模型(LLM)。我们系统比较了三种多阶段训练流程——分别从无指令遵循能力的基础 FM、经事后指令微调增强的基础 FM,以及具备强通用推理能力的指令微调 FM 出发——涵盖持续预训练、监督微调(SFT)、基于人类反馈的强化学习(RLHF)偏好对齐,以及下游任务微调(DTFT)。结果表明,从基础 FM 开始的流程即使经过大量指令微调、SFT 或 RLHF 对齐,也无法发展出有意义的统计推理能力。相比之下,从 LLaMA-3.2-3B-Instruct 出发则能实现有效的领域专用化。对 SFT 变体的全面评估揭示了领域专业知识与通用推理能力之间的明确权衡。我们进一步证明,直接偏好优化能提供稳定且有效的 RLHF 偏好对齐。最后,我们发现在高度优化的模型中,DTFT 必须以极低强度进行,以避免灾难性遗忘。最终模型 StatLLaMA 在数学推理、常识推理和统计专业知识基准上取得了强劲且均衡的性能,为开发资源高效的统计大语言模型提供了实用蓝图。代码可在 https://github.com/HuangDLab/StatLLaMA 获取。
引用
@article{arxiv.2601.09718,
title = {StatLLaMA: Multi-Stage training for domain-optimized statistical large language models},
author = {Jing-Yi Zeng and Guan-Hua Huang},
journal= {arXiv preprint arXiv:2601.09718},
year = {2026}
}
备注
31 pages, 3 figures