InfoLM:一种评估摘要与数据到文本生成的新指标
计算与语言
2022-03-28 v3 人工智能
摘要
通过人工标注评估自然语言生成系统的质量非常昂贵。此外,人工标注活动耗时且包含不可复用的体力劳动。在实践中,研究者依赖自动指标作为质量的替代。在过去十年中,引入了许多基于字符串的指标(如 BLEU)。然而,此类指标通常依赖精确匹配,因此不能稳健地处理同义词。在本文中,我们引入 InfoLM,一系列无训练的度量,可视为基于字符串的指标,借助预训练掩码语言模型解决了上述缺陷。这一系列指标还利用信息度量,使 InfoLM 能适应各种评估标准。使用直接评估,我们证明 InfoLM 在摘要和数据到文本生成上的多种配置中取得了统计显著的改进和超过 点的相关性增益。
引用
@article{arxiv.2112.01589,
title = {InfoLM: A New Metric to Evaluate Summarization & Data2Text Generation},
author = {Pierre Colombo and Chloe Clavel and Pablo Piantanida},
journal= {arXiv preprint arXiv:2112.01589},
year = {2022}
}