中文

陷入困境的 NLP 评估:论针对每个基准测量 LLM 数据污染的必要性

计算与语言 2023-10-30 v1

摘要

在本立场论文中,我们认为使用标注基准对自然语言处理(NLP)任务进行的经典评估已陷入困境。最糟糕的数据污染发生在大型语言模型(LLM)在某一基准的测试集上训练,随后在同一基准上接受评估。该问题的程度尚不明了,因其不易度量。污染会导致受污染模型在目标基准及相关任务上的性能被高估,相对于未受污染的对应模型而言。后果可能极具危害性,错误科学结论被发表而正确的结论遭弃。本立场论文界定了不同层级的数据污染,并呼吁社区共同努力,包括开发自动与半自动措施以检测模型是否接触过基准数据,以及就标注因数据污染而受损的结论的论文提出建议。

关键词

引用

@article{arxiv.2310.18018,
  title  = {NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark},
  author = {Oscar Sainz and Jon Ander Campos and Iker García-Ferrero and Julen Etxaniz and Oier Lopez de Lacalle and Eneko Agirre},
  journal= {arXiv preprint arXiv:2310.18018},
  year   = {2023}
}

备注

Accepted at EMNLP2024-Findings