BEAMetrics:面向语言生成评估的基准
计算与语言
2021-10-19 v1 人工智能
机器学习
摘要
自然语言处理(NLP)系统越来越多地被训练用于生成开放式文本,而非在响应之间进行分类。这使得针对生成语言的评估指标(即在给定上下文和/或人类参考响应的情况下对系统输出进行评分的函数)的研究变得至关重要。然而,不同的指标具有不同的优势和偏差,在某些任务上比在其他任务上更能反映人类直觉。目前,没有一种简单、统一的方法可以在一组具有代表性的任务中比较、分析或评估这些指标。在此,我们描述了评估自动指标基准(BEAMetrics),这是一种使新指标研究本身更易于评估的资源。BEAMetrics 用户可以快速地在多样化的任务、质量维度(流畅性 vs. 连贯性 vs. 信息量等)和语言中,比较现有指标和新指标与人类判断的契合度。正如生成领域专家可能预料的那样,BEAMetrics 揭示了现有指标之间显著的任务依赖性差异,以及在具有复杂答案空间或高度依赖通用知识的任务上持续较差的表现。虽然这一分析突显了当前研究实践面临的一个关键问题,但 BEAMetrics 也通过促进对更优指标的研究——特别是那些能够解释许多现代 NLP 应用中固有的上下文与通用知识之间复杂交互的指标——为解决该问题做出了贡献。BEAMetrics 在 MIT 许可证下提供:https://github.com/ThomasScialom/BEAMetrics
引用
@article{arxiv.2110.09147,
title = {BEAMetrics: A Benchmark for Language Generation Evaluation Evaluation},
author = {Thomas Scialom and Felix Hill},
journal= {arXiv preprint arXiv:2110.09147},
year = {2021}
}