中文

何种技术前沿?呼吁多提示 LLM 评估

计算与语言 2024-05-07 v3

摘要

大型语言模型(LLM)的最新进展促使了各种评估基准的开发。这些基准通常依赖单一的指令模板来评估所有 LLM 在特定任务上的表现。在本文中,我们全面分析了涉及 3 个基准中的 20 个不同 LLM 和 39 项任务的 650 万个实例中,通过单提示评估获得的结果的脆弱性。为了提高分析的稳健性,我们建议使用一组多样化的提示来评估 LLM。我们讨论了针对特定用例(例如,LLM 开发者与对特定下游任务感兴趣的开发者)量身定制的评估指标,确保对 LLM 能力进行更可靠和有意义的评估。随后,我们实现了这些标准并对多个模型进行了评估,为当前 LLM 的真实优势和局限性提供了见解。

关键词

引用

@article{arxiv.2401.00595,
  title  = {State of What Art? A Call for Multi-Prompt LLM Evaluation},
  author = {Moran Mizrahi and Guy Kaplan and Dan Malkin and Rotem Dror and Dafna Shahaf and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2401.00595},
  year   = {2024}
}

备注

Accepted at TACL; pre-MIT Press publication version