中文

NTCIR-18 LLM 自动评估(AEOLLM)任务概述

计算与语言 2025-03-18 v1

摘要

在本文中,我们概述了 NTCIR-18 LLM 自动评估(AEOLLM)任务。随着大型语言模型(LLM)在学术界和工业界日益普及,如何有效评估 LLM 的能力成为一个日益关键但仍具挑战性的问题。现有方法可分为两类:人工评估,成本高昂;自动评估,面临诸多局限,包括任务格式(绝大多数属于多项选择题)和评估准则(被基于参考的指标所占据)。为了推动自动评估的创新,我们提出了 AEOLLM 任务,该任务聚焦于生成式任务并鼓励无参考方法。此外,我们设立了多样化的子任务,如对话生成、文本扩写、摘要生成和非事实型问答,以全面测试不同方法。今年,我们共收到了来自 4 个团队的 48 次运行结果。本文将分别描述该任务的背景、数据集、评估指标和评估结果。

关键词

引用

@article{arxiv.2503.13038,
  title  = {Overview of the NTCIR-18 Automatic Evaluation of LLMs (AEOLLM) Task},
  author = {Junjie Chen and Haitao Li and Zhumin Chu and Yiqun Liu and Qingyao Ai},
  journal= {arXiv preprint arXiv:2503.13038},
  year   = {2025}
}