中文

评估再探讨:自然语言处理中的评估关注点分类法

计算与语言 2026-04-30 v1

摘要

大型语言模型(LLM)的最新进展促使大量研究开始质疑主流评估实践的方法论。然而,许多此类批评在自然语言处理(NLP)领域早已得到广泛讨论:该领域在评估的方法论反思方面有着悠久的历史。我们对 NLP 中关于评估关注点的研究进行了范围综述,并开发了一套分类法,综合了各个领域内反复出现的立场与权衡。我们还讨论了该分类法的实际意义,包括提供一个结构化清单以支持更深思熟虑的评估设计与解释。通过将当代争论置于其历史背景中,本研究为评估实践的推理提供了一个整合的参考。

关键词

引用

@article{arxiv.2604.25923,
  title  = {Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing},
  author = {Ruchira Dhar and Anders Søgaard},
  journal= {arXiv preprint arXiv:2604.25923},
  year   = {2026}
}

备注

Under review