中文

大型语言模型的元探针代理动态评估

计算与语言 2024-06-10 v2 人工智能 机器学习

摘要

大型语言模型(LLM)的评估因数据污染问题在学术界引发广泛关注。现有工作设计了针对特定任务的明确算法评估协议,难以扩展到多样化场景。此外,当前评估基准仅能提供整体结果,无法支持对LLM能力的细粒度和多维度分析。本文提出了元探针代理(MPA),一种受心理学启发用于评估LLM的通用动态评估协议。MPA是DyVal 2的核心组件,自然延续了之前的DyVal工作。MPA设计探针代理和判决代理,自动将原始评估问题转化为新问题,依据心理学理论涉及三种基本认知能力:语言理解、问题解决和领域知识。这些基本能力亦可动态配置,支持多维度分析。我们使用MPA进行了广泛评估,发现大多数LLM性能均表现不佳,仍有提升空间。我们的多维度分析显示,这些基本能力与模型规模隐含的马太效应强相关,即大型模型在这些能力上的相关性更强。MPA还可作为数据增强手段来增强LLM。代码已公开:https://github.com/microsoft/promptbench。

关键词

引用

@article{arxiv.2402.14865,
  title  = {Dynamic Evaluation of Large Language Models by Meta Probing Agents},
  author = {Kaijie Zhu and Jindong Wang and Qinlin Zhao and Ruochen Xu and Xing Xie},
  journal= {arXiv preprint arXiv:2402.14865},
  year   = {2024}
}

备注

International Conference on Machine Learning (ICML) 2024