中文

自改进排行榜(SIL): 呼吁以真实世界为中心的自然语言处理排行榜

计算与语言 2023-03-21 v1 人工智能

摘要

排行榜系统使研究者能够客观评估自然语言处理(NLP)模型,通常用于识别在预定设定下给定任务上表现更优的模型。然而,我们认为在给定测试集上的评估只是模型众多性能指示之一。在本文中,我们主张排行榜竞赛还应旨在识别在真实世界设定中表现最佳的模型。我们指出了当前排行榜系统的三个问题:(1) 使用单一、静态的测试集,(2) 测试与真实世界应用之间的偏差,(3) 以排行榜为中心的竞赛倾向于偏向测试集。作为解决方案,我们提出了一种新的排行榜系统范式,以解决当前排行榜系统的这些问题。通过本研究,我们希望引发向更以真实世界为中心的排行榜竞赛的范式转变。

关键词

引用

@article{arxiv.2303.10888,
  title  = {Self-Improving-Leaderboard(SIL): A Call for Real-World Centric Natural Language Processing Leaderboards},
  author = {Chanjun Park and Hyeonseok Moon and Seolhwa Lee and Jaehyung Seo and Sugyeong Eo and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2303.10888},
  year   = {2023}
}