CTRLEval:一种用于评估受控文本生成的无监督无参考度量
计算与语言
2022-12-06 v2 人工智能
摘要
现有的无参考度量在评估受控文本生成模型方面存在明显局限。无监督度量只能提供与人工判断弱相关的任务无关评估结果,而有监督度量可能过拟合特定任务数据,对其他数据集泛化能力差。本文提出一种称为 CTRLEval 的无监督无参考度量,其通过将每个方面建模为多个文本填充任务,从不同方面评估受控文本生成。在这些任务之上,该度量在不进行任何模型训练的情况下组装来自预训练语言模型的生成概率。实验结果表明,我们的度量与人工判断的相关性高于其他基线,同时对评估来自不同模型及具有不同质量的生成文本获得了更好的泛化性。
引用
@article{arxiv.2204.00862,
title = {CTRLEval: An Unsupervised Reference-Free Metric for Evaluating Controlled Text Generation},
author = {Pei Ke and Hao Zhou and Yankai Lin and Peng Li and Jie Zhou and Xiaoyan Zhu and Minlie Huang},
journal= {arXiv preprint arXiv:2204.00862},
year = {2022}
}
备注
Accepted by ACL 2022 (Main Conference)