中文

D-模型与 E-模型:大型语言模型采样行为中的多样性-稳定性权衡

计算与语言 2026-01-30 v2

摘要

大型语言模型 (LLM) 中下一 token 的预测概率 (P_token) 与下一条信息的相关性概率、下一产品的购买概率以及下一动作的执行概率有着不可分割的联系——所有这些均属于任务级目标分布 (P_task) 的范畴。尽管已知 LLM 能生成近似真实世界分布的样本,其细粒度采样概率是否忠实地契合任务要求仍是一个悬而未决的问题。通过受控分布采样模拟,我们揭示了 LLM 行为中显著的二分性,区分出两类模型:D-模型(如 Qwen-2.5),其 P_token 呈现较大的逐步变异性且与 P_task 对齐较差;以及 E-模型(如 Mistral-Small),其 P_token 更稳定且与 P_task 对齐更好。我们进一步在代码生成和推荐等下游任务中评估这两类模型,揭示了影响任务结果的多样性与稳定性之间的系统性权衡。最后,我们分析两个模型家族的内部属性以探究其底层机制。这些发现为 LLM 的概率采样行为提供了基础性见解,并就何时应偏好 D-模型还是 E-模型提供了实用指导。对于推荐、搜索和对话代理等网络规模应用,我们的结果为模型选择与配置提供了参考,以在真实世界不确定性下平衡多样性与可靠性,并提供了更好的可解释性。

关键词

引用

@article{arxiv.2601.17865,
  title  = {D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models},
  author = {Jia Gu and Liang Pang and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2601.17865},
  year   = {2026}
}

备注

12 pages, 10 figures. Accepted by WWW'26