面向问题生成的自动可答性评估
计算与语言
2024-02-27 v2
摘要
为自然语言生成(NLG)任务开发的常规自动评估指标(如 BLEU 与 ROUGE)基于度量生成文本与参考文本之间的 n-gram 重叠。这些简单指标对于更复杂的任务(如问题生成(QG),其要求生成可由参考答案回答的问题)可能不够充分。因此,开发更精细的自动评估指标仍是 QG 研究中的紧迫问题。本工作提出 PMAN(基于提示的可答性度量,Prompting-based Metric on ANswerability),一种新颖的自动评估指标,用于评估所生成问题是否可由 QG 任务的参考答案回答。大量实验表明其评估结果可靠且与人类评估一致。我们进一步将我们的指标应用于评估 QG 模型的性能,显示我们的指标对常规指标形成补充。我们所实现的基于 GPT 的 QG 模型在生成可回答问题方面达到了最先进性能。
引用
@article{arxiv.2309.12546,
title = {Automatic Answerability Evaluation for Question Generation},
author = {Zifan Wang and Kotaro Funakoshi and Manabu Okumura},
journal= {arXiv preprint arXiv:2309.12546},
year = {2024}
}