面向大型语言模型评估:考虑指令模板间得分方差
计算与语言
2024-08-23 v1 人工智能
机器学习
摘要
大型语言模型(LLM)的自然语言理解(NLU)性能已在各种任务和数据集上进行评估。然而,现有的评估方法未考虑由于提示差异导致的得分方差,导致对 NLU 性能的公平评估和比较存在问题。此外,针对特定提示设计的评估不适用于指令调优,因为指令调优旨在能够良好地适应任何提示。因此,有必要找到一种在考虑不同指令模板之间的得分方差时衡量 NLU 性能的公平方法。本研究提供了英文和日文跨语言数据集,用于评估 LLM 的 NLU 性能,这些数据集包含多个指令模板,以公平评估每个任务,同时包含约束输出格式的正则表达式。此外,我们提出了考虑模板间得分方差的 Sharpe 评分作为评估指标。对英文和日文 LLM 的全面分析表明,模板间的高方差对 LLM 的公平评估具有显著影响。
引用
@article{arxiv.2408.12263,
title = {Toward the Evaluation of Large Language Models Considering Score Variance across Instruction Templates},
author = {Yusuke Sakai and Adam Nohejl and Jiangnan Hang and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2408.12263},
year = {2024}
}
备注
19 pages, 7 figures