迈向文本生成统一的多元评估器
计算与语言
2022-10-14 v1
摘要
多元评估是自然语言生成(NLG)中人工评估的主导范式,即从连贯性、流畅性等多个可解释维度评估生成文本。然而,NLG 中的自动评估仍由基于相似度的度量主导,我们缺乏一个可靠的框架来对先进模型进行更全面的评估。本文中,我们提出面向 NLG 的统一多元评估器 UniEval。我们将 NLG 评估重新构建为布尔问答(QA)任务,并通过用不同问题引导模型,可使用一个评估器从多个维度进行评估。此外,得益于统一的布尔 QA 格式,我们能够引入一个中间学习阶段,使 UniEval 能从多个相关任务中融入外部知识并获得进一步提升。在三个典型 NLG 任务上的实验表明,UniEval 与人工判断的相关性显著优于现有度量。具体而言,与性能最优的统一评估器相比,UniEval 在文本摘要上相关性提高 23%,在对话响应生成上提高逾 43%。同时,UniEval 对未见过的评估维度与任务展现出强大的零样本学习能力。源代码、数据及所有预训练评估器均发布于我们的 GitHub 仓库(https://github.com/maszhongming/UniEval)。
引用
@article{arxiv.2210.07197,
title = {Towards a Unified Multi-Dimensional Evaluator for Text Generation},
author = {Ming Zhong and Yang Liu and Da Yin and Yuning Mao and Yizhu Jiao and Pengfei Liu and Chenguang Zhu and Heng Ji and Jiawei Han},
journal= {arXiv preprint arXiv:2210.07197},
year = {2022}
}
备注
EMNLP 2022