中文

RQUGE:通过回答问题评估问题生成的免参考指标

计算与语言 2023-05-29 v3 人工智能 机器学习

摘要

现有用于评估自动生成问题质量的指标,如 BLEU、ROUGE、BERTScore 和 BLEURT,比较参考问题与预测问题,当候选问题与参考问题之间存在显著词汇重叠或语义相似时给出高分。这种方法有两个主要缺陷。首先,我们需要昂贵的人工提供的参考问题。其次,它会惩罚可能与参考问题词汇或语义相似度不高但有效的问题。在本文中,我们提出一种新指标 RQUGE,基于给定上下文下候选问题的可回答性。该指标由问答模块和跨度打分模块组成,使用现有文献中的预训练模型,因此无需进一步训练即可使用。我们证明 RQUGE 在不依赖参考问题的情况下与人类判断具有更高的相关性。此外,RQUGE 对若干对抗性扰动表现出更强的鲁棒性。进一步,我们说明通过对问题生成模型生成的合成数据进行微调并由 RQUGE 重排序,可显著提升 QA 模型在域外数据集上的性能。

关键词

引用

@article{arxiv.2211.01482,
  title  = {RQUGE: Reference-Free Metric for Evaluating Question Generation by Answering the Question},
  author = {Alireza Mohammadshahi and Thomas Scialom and Majid Yazdani and Pouya Yanki and Angela Fan and James Henderson and Marzieh Saeidi},
  journal= {arXiv preprint arXiv:2211.01482},
  year   = {2023}
}

备注

Accepted to Findings of ACL 2023