中文

EvalTree:通过分层能力树剖析语言模型弱点

计算与语言 2025-07-14 v2 机器学习

摘要

理想的模型评估应实现两个目标:识别模型在何处失败以及提供可操作的改进指导。为了实现语言模型(LM)评估的这些目标,我们将问题表述为:给定 LM 在基准测试中每个单独实例上的表现,生成一个弱点剖析,即一组用自然语言表达的弱点。我们引入了一套定量评估方法来比较不同的弱点剖析方法。我们还引入了一种弱点剖析方法 EvalTree。EvalTree 构建了一棵能力树,其中每个节点代表一种用自然语言描述的能力,并链接到专门评估该能力的基准实例子集;随后提取 LM 表现不佳的节点以生成弱点剖析。在 MATH 和 WildChat 基准测试上,我们表明 EvalTree 通过更精确、更全面地识别弱点,优于基线弱点剖析方法。弱点剖析进一步实现了弱点引导的数据收集,而由 EvalTree 识别的弱点引导的训练数据收集比其他数据收集策略更能提高 LM 性能。我们还展示了 EvalTree 如何暴露 Chatbot Arena 基于人类投票者评估实践中的缺陷。为了促进未来的工作,我们提供了一个界面,允许从业者交互式地探索由 EvalTree 构建的能力树。

关键词

引用

@article{arxiv.2503.08893,
  title  = {EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees},
  author = {Zhiyuan Zeng and Yizhong Wang and Hannaneh Hajishirzi and Pang Wei Koh},
  journal= {arXiv preprint arXiv:2503.08893},
  year   = {2025}
}

备注

COLM 2025