MIRROR:用于自动化开放式问题生成评估的新方法
计算与语言
2025-03-26 v3 人工智能
摘要
自动问题生成是一个关键任务,需要通过考虑诸如参与度、教育价值以及激发批判性思维能力等因素来评估问题质量。这些方面需要人类般的理解和判断能力,而当前的自动化系统尚不具备。然而,人类评估在大量生成问题样本上成本高昂且不实用。因此,我们提出了一种新系统,MIRROR (Multi-LLM Iterative Review and Response for Optimized Rating),该系统利用大语言模型 (LLMs) 来自动化对由自动问题生成系统生成的问题进行评估。我们实验了几种最先进的 LLMs,如 GPT-4、Gemini 和 Llama2-70b。我们观察到,当使用称为 MIRROR 的反馈驱动方法时,人类评估指标(包括相关性、适当性、新颖性、复杂度和语法性)的分数趋于人类基准分数。此外,我们观察到在使用我们提出的反馈驱动方法 MIRROR 相较于直接对评估进行提示时,GPT-4 与人类专家之间的皮尔逊相关系数得分有所提高。错误分析显示,我们提出的方法 MIRROR 在显著提高相关性和适当性方面发挥了重要作用。
引用
@article{arxiv.2410.12893,
title = {MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation},
author = {Aniket Deroy and Subhankar Maity and Sudeshna Sarkar},
journal= {arXiv preprint arXiv:2410.12893},
year = {2025}
}
备注
Updated Version