基于参考的指标在问题生成任务中自我证伪
计算与语言
2024-10-11 v3 人工智能
机器学习
摘要
基于参考的指标,如 BLEU 和 BERTScore,被广泛用于评估问题生成 (QG)。在本研究中,我们在 SQuAD 和 HotpotQA 等问题生成基准上发现,使用人工编写的参考并不能保证基于参考指标的有效性。大多数问题生成基准只有一个参考;我们复现了标注过程并收集了另一个参考。一个好的指标应当对人工验证的问题给出的评分不低于对生成问题的评分。然而,基于参考的指标在我们新收集的参考上的结果证伪了这些指标本身。我们提出了一种由多维度标准(如自然度、可回答性和复杂性)组成的无参考指标,并利用了大语言模型。这些标准不受限于单个参考问题的句法或语义,且该指标不需要多样化的参考集。实验表明,我们的指标能准确区分高质量问题与有缺陷的问题,并在与人类判断的一致性上达到了最先进水平。
引用
@article{arxiv.2403.12242,
title = {Reference-based Metrics Disprove Themselves in Question Generation},
author = {Bang Nguyen and Mengxia Yu and Yun Huang and Meng Jiang},
journal= {arXiv preprint arXiv:2403.12242},
year = {2024}
}
备注
EMNLP 2024 Findings - Camera Ready