中文

语言模型增强的相关性分数

计算与语言 2021-08-20 v1 机器学习

摘要

尽管自动化指标常用于评估 NLG 系统,它们往往与人类判断相关性较差。BERTScore 等较新指标解决了先前如 BLEU 和 ROUGE 等依赖 n-gram 匹配指标的诸多弱点。然而,这些较新方法仍有限制,即未考虑生成语境,因此无法恰当地奖励正确但偏离给定参考的生成文本。在本文中,我们提出语言模型增强的相关性分数(MARS),一种用于 NLG 评估的语境感知新指标。MARS 利用现成语言模型,在强化学习引导下,创建同时考虑生成语境与可用人类参考的增强参考,随后将其用作评分生成文本的额外参考。在三项常见 NLG 任务中与七种现有指标相比,MARS 不仅与人类参考判断达到更高相关性,且更大程度地区分格式良好的候选与对抗样本。

关键词

引用

@article{arxiv.2108.08485,
  title  = {Language Model Augmented Relevance Score},
  author = {Ruibo Liu and Jason Wei and Soroush Vosoughi},
  journal= {arXiv preprint arXiv:2108.08485},
  year   = {2021}
}

备注

In ACL 2021