中文

人或机器:NLG 文本类人程度评价的自动化

计算与语言 2020-06-08 v1 机器学习

摘要

对数据驱动智能方法产生的各类文本质量准则进行自动评价非常常见且有用,因其廉价、快速且通常产生可重复结果。本文中,我们提出一种尝试,将用于解决若干任务的自然语言生成方法输出文本样本的类人程度评价自动化。我们提出使用类人程度分数,表明某方法输出样本中看起来如同人类所写者的百分比。我们不使用人类参与者标注或评分这些样本,而是完全基于大型预训练语言模型及其概率分布所构建的判别流程将过程自动化。作为后续,我们计划对人工撰写与机器生成文本进行实证分析,以寻找该评价方法的最优设置。涉及人类参与者的验证流程也将检验自动评价与人类判断的相关性。

关键词

引用

@article{arxiv.2006.03189,
  title  = {Human or Machine: Automating Human Likeliness Evaluation of NLG Texts},
  author = {Erion Çano and Ondřej Bojar},
  journal= {arXiv preprint arXiv:2006.03189},
  year   = {2020}
}

备注

9 pages, 5 equations, 1 table