面向合成流量生成任务的语言生成模型评估指标
计算与语言
2023-11-22 v1
摘要
许多自然语言生成(NLG)任务旨在给定输入提示后生成单一输出文本。其他场景需要生成多个文本,例如用于合成流量生成(STG)。该生成任务对于训练和评估问答系统以及对话智能体至关重要,其目标是生成多个问题或话语,以 resembling 真实用户的语言变异性。在本文中,我们表明常见的 NLG 指标(如 BLEU)不适合评估 STG。我们提出并评估了若干旨在将生成的流量与真实用户文本分布进行比较的指标。我们通过自动程序验证我们的指标是否捕捉到生成数据的不同类型质量问题;我们还进行了人工标注以验证其与人类判断的相关性。在三个任务(即购物话语生成、产品问题生成和查询自动补全)上的实验表明,我们的指标对于评估 STG 任务十分有效,并且相对于常见的 NLG 指标,与人类判断的一致性提高了至多 20%。我们相信这些发现可以为更好地评估合成文本数据代表性程度的方案铺平道路。
引用
@article{arxiv.2311.12534,
title = {Evaluation Metrics of Language Generation Models for Synthetic Traffic Generation Tasks},
author = {Simone Filice and Jason Ingyu Choi and Giuseppe Castellucci and Eugene Agichtein and Oleg Rokhlenko},
journal= {arXiv preprint arXiv:2311.12534},
year = {2023}
}