中文

WISCA:一种轻量级模型转换方法,通过权重缩放提升 LLM 训练

机器学习 2026-04-23 v2 计算与语言

摘要

Transformer 架构正逐渐主导 LLM 领域。近期在 Transformer-based 大型语言模型 (LLMs) 的训练优化方面,主要聚焦于架构修改或优化器调整。然而,这些方法缺乏对训练期间权重模式的系统性优化。所谓权重模式指的是神经网络中权重参数的分布及其相对大小。在解决此问题后,本文提出了一种称为 WISCA 的权重缩放方法,通过在不改变网络结构的情况下战略性地改善神经网络的权重模式,从而提高训练效率和模型质量。通过重新缩放权重而保持模型输出不变,WISCA 间接优化了模型的训练轨迹。实验表明,WISCA 在提高收敛质量(以泛化能力和损失降低为指标)方面具有显著效果,尤其是在采用分组查询注意力 (GQA) 架构和 LoRA 微调任务的 LLMs 中。实证结果显示,在多个架构上,零样本验证任务平均提升 5.6%,训练困惑度平均降低 2.12%。

关键词

引用

@article{arxiv.2508.16676,
  title  = {WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling},
  author = {Jiacheng Li and Jianchao Tan and Zhidong Yang and Pingwei Sun and Feiye Huo and Jiayu Qin and Xiangyu Zhang and Maoxin He and Yerui Sun and Yuchen Xie and Guangming Tan and Weile Jia and Xunliang Cai and Tong Zhao},
  journal= {arXiv preprint arXiv:2508.16676},
  year   = {2026}
}

备注

Findings of the Association for Computational Linguistics: ACL 2026