ProbeLLM:自动化 LLM 故障的原则性诊断
计算与语言
2026-02-16 v1 软件工程
摘要
理解大语言模型(LLM)如何以及为何失败正 becoming 为中心挑战,由于模型快速演化,静态评估已落后于时代。尽管自动探测已通过动态测试生成实现,但现有方法往往发现孤立的故障案例,缺乏对探索的原则性控制,提供有限的关于模型弱点的结构性见解。我们提出 ProbeLLM,一个无特定基准的自动化探测框架,将弱点发现从单个故障提升为结构化的故障模式。ProbeLLM 将探测建模为分层蒙特卡洞树搜索,显式地在新故障区域的全局探索和重复错误模式的局部细化之间分配有限的探测预算。通过限制在可验证的测试案例中进行探测,并利用工具增强的生成和验证,ProbeLLM 将故障发现置于可靠的证据基础上。通过基于故障感知的嵌入和基于边界的归纳,将发现的故障进一步整合为可解释的故障模式。跨越 diverse 基准和 LLM,ProbeLLM 显示比静态基准和先前自动方法更广泛、更干净、更细致的故障景观,支持从案例中心的评估向原则性弱点发现的转变。
引用
@article{arxiv.2602.12966,
title = {ProbeLLM: Automating Principled Diagnosis of LLM Failures},
author = {Yue Huang and Zhengzhe Jiang and Yuchen Ma and Yu Jiang and Xiangqi Wang and Yujun Zhou and Yuexing Hao and Kehan Guo and Pin-Yu Chen and Stefan Feuerriegel and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2602.12966},
year = {2026}
}