WRDScore:自然语言生成模型评估的新指标
计算与语言
2024-08-14 v5 人工智能
摘要
评估自然语言生成模型,特别是方法名预测,面临重大挑战。一个稳健的指标必须考虑方法命名的多样性,兼顾语义和句法变化。传统的基于重叠的指标(如ROUGE)无法捕捉这些细微差别。现有的基于嵌入的指标通常存在精确率和召回率不平衡、缺乏归一化分数或对序列做出不切实际假设的问题。为了解决这些局限性,我们利用最优传输理论构建了WRDScore,一种在简单性和有效性之间取得平衡的新颖指标。在WRDScore框架中,我们将精确率定义为预测序列的标记逐个被参考序列包含的最大程度。召回率计算为将参考序列映射到预测序列的最优传输计划的总成本。最后,WRDScore计算为精确率和召回率的调和平均值,平衡这两个互补指标。我们的指标轻量级、归一化且面向精确率-召回率,避免了不切实际的假设,同时与人类判断高度一致。在人工策划的数据集上的实验证实了WRDScore优于其他可用的文本指标。
引用
@article{arxiv.2405.19220,
title = {WRDScore: New Metric for Evaluation of Natural Language Generation Models},
author = {Ravil Mussabayev},
journal= {arXiv preprint arXiv:2405.19220},
year = {2024}
}
备注
Accepted to IEEE Xplore