迈向神经语言评估器
计算与语言
2019-11-01 v2 人工智能
机器学习
摘要
我们审视了 BLEU 和 ROUGE——这两种用于评估参考摘要与假设摘要的最流行指标——的三个局限性,提出了一个好的指标应具备的行为准则,并给出了利用基于 Transformer 的最新语言模型来评估参考摘要与假设摘要的具体方法。
引用
@article{arxiv.1909.09268,
title = {Towards Neural Language Evaluators},
author = {Hassan Kané and Yusuf Kocyigit and Pelkins Ajanoh and Ali Abdalla and Mohamed Coulibali},
journal= {arXiv preprint arXiv:1909.09268},
year = {2019}
}
备注
Accepted to NeurIPS 2019 Document Intelligence Workshop