中文

ReIFE:重新评估指令遵循评估

计算与语言 2024-10-10 v1 人工智能 机器学习

摘要

指令遵循的自动评估通常涉及使用大型语言模型(LLM)来评估响应质量。然而,缺乏对这些LLM评估器在两个维度上的全面评估:基础LLM和评估协议。因此,我们对指令遵循进行了一次彻底的元评估,包括25个基础LLM和15个最近提出的评估协议,基于4个人工标注数据集,对评估LLM评估器的评估准确性进行评估。我们的评估使我们能够以高度的鲁棒性识别最佳-performing的基础LLM和评估协议。此外,我们的大规模评估揭示了:(1)基础LLM性能排名在评估协议之间基本保持一致,较不擅长的LLM从协议增强中表现提升更显著;(2)对评估协议的鲁棒评估需要大量具有不同能力水平的基础LLM,因为协议效果可能取决于所使用的基础LLM;(3)不同数据集上的评估结果并不总是一致的,因此严格的评估需要多个具有不同特征的数据集。我们发布了我们的元评估套件ReIFE,为超过500种LLM评估器配置提供代码库和评估结果收集,以支持未来指令遵循评估研究。

关键词

引用

@article{arxiv.2410.07069,
  title  = {ReIFE: Re-evaluating Instruction-Following Evaluation},
  author = {Yixin Liu and Kejian Shi and Alexander R. Fabbri and Yilun Zhao and Peifeng Wang and Chien-Sheng Wu and Shafiq Joty and Arman Cohan},
  journal= {arXiv preprint arXiv:2410.07069},
  year   = {2024}
}

备注

GitHub Repo: https://github.com/yale-nlp/ReIFE, Evaluation Result Collection: https://huggingface.co/datasets/yale-nlp/ReIFE