QGEval:面向问题生成的多维度评估基准
计算与语言
2024-10-11 v2 人工智能
摘要
自动生成的问题常常存在表达不清或事实不准确等问题,需要对其质量进行可靠且全面的评估。人工评估在问题生成(QG)领域被广泛使用,并作为自动评估指标的金标准。然而,缺乏统一的人工评估标准,这阻碍了对QG模型和自动评估指标进行一致且可靠的评估。为了解决这个问题,我们提出了QGEval,一个面向问题生成的多维度评估基准,它从7个维度评估生成的问题和现有的自动评估指标:流畅性、清晰性、简洁性、相关性、一致性、可回答性和答案一致性。我们通过检查这些维度的相关性和区别来证明其适当性。通过使用QGEval对QG模型和自动评估指标进行一致评估,我们发现:1) 大多数QG模型在可回答性和答案一致性方面表现不佳,2) 现有评估指标在评估生成的问题时,在7个维度上与人类判断的一致性较差。我们希望这项工作能够促进QG技术及其评估的发展。
引用
@article{arxiv.2406.05707,
title = {QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation},
author = {Weiping Fu and Bifan Wei and Jianxiang Hu and Zhongmin Cai and Jun Liu},
journal= {arXiv preprint arXiv:2406.05707},
year = {2024}
}
备注
Accepted by EMNLP 2024