面向自然语言生成类人评估的误差分析方法
计算与语言
2022-12-21 v1
摘要
基于最先进语言模型的自动度量指标(如 BARTScore)受益于大规模上下文预训练,已成功应用于包括机器翻译、文本摘要和数据到文本在内的广泛自然语言生成(NLG)任务。近期研究表明,同时考虑主要错误(如误译词元)与次要错误(如流畅性缺陷)可产生高质量的人类判断。这启发我们通过自动误差分析来逼近评估指标的最终目标(类人评估)。为此,我们通过融入类人误差分析策略来增强 BARTScore,即 BARTScore++,其最终分数由主要错误与次要错误的评估共同构成。实验结果表明,BARTScore++ 能一致地提升原始 BARTScore 的性能,并在 25 个测试设定中的 20 个上超越现有最高分指标。我们希望该技术也能扩展到其他基于预训练模型的指标。我们将发布代码与脚本以惠及社区。
引用
@article{arxiv.2212.10179,
title = {Toward Human-Like Evaluation for Natural Language Generation with Error Analysis},
author = {Qingyu Lu and Liang Ding and Liping Xie and Kanjian Zhang and Derek F. Wong and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.10179},
year = {2022}
}
备注
work in progress