中文

随机性下的可靠性:稀疏与稠密语言模型在解码温度下的实证分析

机器学习 2026-01-06 v1 计算与语言

摘要

稀疏 Mixture-of-Experts (MoE) 架构在大型语言模型中的日益普及引发了关于其在随机解码下的可靠性的重要问题。虽然条件计算在计算效率方面实现了显著的提升,但仍不清楚稀疏路由与基于温度的抽样之间的相互作用是否会导致相对于稠密架构的输出稳定性下降。本工作调查稀疏 MoE 模型是否放大解码引起的随机性,从而在温度升高时导致可靠性降低。我们在确定性算术推理任务(具有可验证答案)上评估了三个代表性模型:OLMoE-7B(稀疏 base)、Mixtral-8x7B(稀疏 instruction-tuned)和 Qwen2.5-3B(稠密 instruction-tuned),实验覆盖四种解码配置,从贪婪解码到 T=1.0。我们的评估包括准确率、格式合规性、重复生成的输出一致性和置信度指标,总计 9,360 次模型生成。结果表明,稀疏 instruction-tuned 模型在所有解码温度下都表现出与稠密 instruction-tuned 模型相当的稳定性,而稀疏 base 模型则随温度升高表现出系统性的性能下降。这些发现表明,指令微调而非架构稀疏性是支配确定性任务对解码随机性鲁棒性的主要因素。我们讨论了这些结果在部署可靠性关键应用的稀疏语言模型方面的意义,突出了在不牺牲输出稳定性的前提下安全采纳稀疏架构的场景。

关键词

引用

@article{arxiv.2601.00942,
  title  = {Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures},
  author = {Kabir Grover},
  journal= {arXiv preprint arXiv:2601.00942},
  year   = {2026}
}