ErrorMap与ErrorAtlas:绘制大型语言模型的故障全景图
人工智能
2026-02-18 v2 计算与语言
摘要
大型语言模型(LLM)基准测试告诉我们模型何时失败,但未揭示它们为何失败。推理数据集上的一个错误答案可能源于格式问题、计算错误或数据集噪声,而非推理能力弱。若不厘清这些原因,基准测试就是不完整的,无法可靠地指导模型改进。我们引入了ErrorMap,这是第一种绘制LLM故障来源的方法。它提取模型独特的“故障签名”,阐明基准测试实际测量了什么,并拓宽错误识别范围以减少盲点。这有助于开发者调试模型,使基准测试目标与结果对齐,并支持明智的模型选择。ErrorMap以相同的逻辑适用于任何模型或数据集。将我们的方法应用于35个数据集和83个模型,我们生成了ErrorAtlas,一个模型错误的分类体系,揭示了反复出现的故障模式。ErrorAtlas突出了当前LLM研究中探索不足的错误类型,例如输出中遗漏必要细节和问题误解。通过将焦点从模型在哪里成功转移到它们为何失败,ErrorMap和ErrorAtlas实现了高级评估——一种揭示隐藏弱点并指导进步的评估。与通常通过任务级指标衡量的成功不同,我们的方法引入了一个更深层次的评估层,可以跨模型和任务全局应用,为模型行为和局限性提供更丰富的洞察。我们公开了该分类体系和代码,并计划随着新基准和模型的出现定期更新ErrorAtlas。
引用
@article{arxiv.2601.15812,
title = {ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models},
author = {Shir Ashury-Tahan and Yifan Mai and Elron Bandel and Michal Shmueli-Scheuer and Leshem Choshen},
journal= {arXiv preprint arXiv:2601.15812},
year = {2026}
}