中文

自然语言生成中的自动度量:当前评估实践综述

计算与语言 2024-08-20 v1

摘要

自动度量被广泛用于评估自然语言处理系统。然而,该领域内从业者如何使用和报告这些度量已受到越来越多的关注。在本文中,我们对自动度量的使用进行了一项综述,特别关注自然语言生成(NLG)任务。我们检查了使用了哪些度量、为何选择它们以及如何报告它们的使用情况。我们的综述发现揭示了显著的不足,包括不恰当的度量使用、缺乏实现细节以及缺少与人类判断的相关性。最后,我们提出了一些建议,相信作者应遵循这些建议,以使该领域更加严谨。

关键词

引用

@article{arxiv.2408.09169,
  title  = {Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices},
  author = {Patrícia Schmidtová and Saad Mahamood and Simone Balloccu and Ondřej Dušek and Albert Gatt and Dimitra Gkatzia and David M. Howcroft and Ondřej Plátek and Adarsa Sivaprasad},
  journal= {arXiv preprint arXiv:2408.09169},
  year   = {2024}
}

备注

Accepted to INLG 2024