自然语言生成中的自动度量:当前评估实践综述
计算与语言
2024-08-20 v1
摘要
自动度量被广泛用于评估自然语言处理系统。然而,该领域内从业者如何使用和报告这些度量已受到越来越多的关注。在本文中,我们对自动度量的使用进行了一项综述,特别关注自然语言生成(NLG)任务。我们检查了使用了哪些度量、为何选择它们以及如何报告它们的使用情况。我们的综述发现揭示了显著的不足,包括不恰当的度量使用、缺乏实现细节以及缺少与人类判断的相关性。最后,我们提出了一些建议,相信作者应遵循这些建议,以使该领域更加严谨。
引用
@article{arxiv.2408.09169,
title = {Automatic Metrics in Natural Language Generation: A Survey of Current Evaluation Practices},
author = {Patrícia Schmidtová and Saad Mahamood and Simone Balloccu and Ondřej Dušek and Albert Gatt and Dimitra Gkatzia and David M. Howcroft and Ondřej Plátek and Adarsa Sivaprasad},
journal= {arXiv preprint arXiv:2408.09169},
year = {2024}
}
备注
Accepted to INLG 2024