中文

Learn-by-Wire训练控制治理:稳定性与效率下的受限自主训练

人工智能 2026-05-20 v1 计算与语言 机器学习

摘要

现代语言模型训练在激进的学习率、规模和运行压力条件下,正日益暴露于不稳定、性能下降的运行以及浪费计算资源的问题。本文引入Learn-by-Wire Guard (LBW-Guard),这是一种在AdamW之上运行的受限自主训练控制治理层。本方法不取代优化器更新规则,而是观察训练遥测,解释不稳定敏感的情形,并在保持固定训练目标的前提下,对优化器执行施加受限控制。我们在以Qwen2.5为中心的压力与鲁棒性套件中评估LBW-Guard,包括WikiText-103,使用Qwen2.5-7B作为实证锚点,规模对比Qwen2.5-3B和Qwen2.5-14B,学习率压力测试,梯度裁剪基线,以及无LoRA的TinyLlama-1B全参数良心检验。在7B参考设置下,LBW-Guard将最终困惑度从13.21降低到10.74,改进18.7%,同时将端到端时间从392.54s缩短到357.02s,加速1.10倍。在更强的学习率压力下,AdamW在LR=3e-3时退化到1885.24的最终困惑度,在LR=1e-3时为659.76,而LBW-Guard分别保持可训练在11.57和10.33。梯度裁剪基线未能复现此效果。这些结果支持一种受限的系统性结论,即稳定性敏感的LLM训练从属于优化器之上的治理层可获益。LBW-Guard提供证据表明,受限运行控制可在压力下保持生产性计算,同时与优化器替换和局部梯度抑制保持区别。

关键词

引用

@article{arxiv.2605.19008,
  title  = {Learn-by-Wire Training Control Governance: Bounded Autonomous Training Under Stress for Stability and Efficiency},
  author = {Anis Radianis},
  journal= {arXiv preprint arXiv:2605.19008},
  year   = {2026}
}