评估再探讨:自然语言处理中的评估关注点分类法
计算与语言
2026-04-30 v1
摘要
大型语言模型(LLM)的最新进展促使大量研究开始质疑主流评估实践的方法论。然而,许多此类批评在自然语言处理(NLP)领域早已得到广泛讨论:该领域在评估的方法论反思方面有着悠久的历史。我们对 NLP 中关于评估关注点的研究进行了范围综述,并开发了一套分类法,综合了各个领域内反复出现的立场与权衡。我们还讨论了该分类法的实际意义,包括提供一个结构化清单以支持更深思熟虑的评估设计与解释。通过将当代争论置于其历史背景中,本研究为评估实践的推理提供了一个整合的参考。
引用
@article{arxiv.2604.25923,
title = {Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing},
author = {Ruchira Dhar and Anders Søgaard},
journal= {arXiv preprint arXiv:2604.25923},
year = {2026}
}
备注
Under review