为什么 LLM 会停止计算:开源 LLM 中用户报告失败的实证研究
计算与语言
2026-01-21 v1
摘要
开源大型语言模型(LLM)的民主化允许用户在本地基础设施上微调和部署模型,但使他们暴露于“第一英里”部署环境中。与黑盒 API 消费不同,用户管理的编排的可靠性仍然是一个关键的盲点。为了弥合这一差距,我们对来自开源 DeepSeek、Llama 和 Qwen 生态系统的 705 个真实世界失败案例进行了首次大规模实证研究。我们的分析揭示了范式转变:白盒编排将可靠性瓶颈从模型算法缺陷转移到部署栈的系统性脆弱性。我们识别出三个关键现象:(1)诊断分歧:运行时崩溃独特地标志着基础设施摩擦,而不正确的功能则作为内部分词器缺陷的特征。(2)系统同质性:根本原因在不同系列间趋同,证实了可靠性障碍是共享生态系统固有的,而非特定架构。(3)生命周期升级:障碍从微调期间内在的配置困难升级到推理期间复合的环境不兼容性。在我们公开可用的数据集支持下,这些见解为提升 LLM 生态系统的可靠性提供了可操作的指导。
引用
@article{arxiv.2601.13658,
title = {Beyond Known Facts: Generating Unseen Temporal Knowledge to Address Data Contamination in LLM Evaluation},
author = {Arthur Amalvy and Hen-Hsen Huang},
journal= {arXiv preprint arXiv:2601.13658},
year = {2026}
}
备注
12 pages