中文

任务不确定性下的大语言模型评估框架

机器学习 2024-11-22 v1 计算与语言 人机交互

摘要

大语言模型(LLM)评估通常假设评估语料库中的每个项目只有一个正确响应——即黄金标签。然而,某些任务可能是模糊的——即它们提供的信息不足以确定唯一的解释——或者含糊的——即它们没有明确指示在做出判断时如何划定界限。模糊性和含糊性都可能导致任务不确定性——即评估语料库中的某些项目有多个正确响应的情况。本文开发了一个在任务不确定性下评估LLM的框架。我们的框架厘清了LLM评估流程中任务规范、人工评分和LLM响应之间的关系。利用我们的框架,我们进行了一项合成实验,表明使用“黄金标签”假设的评估低估了真实性能。我们还提供了一种方法,在部分了解评估语料库中不确定项目的情况下,估计误差调整后的性能区间。最后,我们概述了我们的工作对研究界的启示。

关键词

引用

@article{arxiv.2411.13760,
  title  = {A Framework for Evaluating LLMs Under Task Indeterminacy},
  author = {Luke Guerdan and Hanna Wallach and Solon Barocas and Alexandra Chouldechova},
  journal= {arXiv preprint arXiv:2411.13760},
  year   = {2024}
}

备注

To Appear in NeurIPS 2024 Workshops on Evaluating Evaluations (EvalEval) and Statistical Foundations of LLMs and Foundation Models (SFLLM)