中文

面向问题生成的误差感知评估:通过显式诊断实现ErrEval

人工智能 2026-01-16 v1

摘要

自动问题生成 (QG)常产生关键缺陷,如事实幻觉和答案不匹配。然而,现有评估方法,包括基于大语言模型的评估器,主要采用黑盒和整体范式,缺乏对此类缺陷的显式建模,导致低估问题质量。为此,我们提出ErrEval:一个灵活的、面向错误的评估框架,通过显式错误诊断来增强QG评估。具体而言,ErrEval将评估重新定义为错误诊断后再进行知情评分的两个阶段。在第一阶段,一个轻量级即插即用错误识别器检测并分类结构、语言和内容相关方面的常见错误。这些诊断信号随后被纳入作为显式证据,以指导LLM评估器进行更细致、更扎实的判断。大量实验在三个基准数据集上表明,ErrEval的有效性,显示将显式诊断纳入后,与人类判断的对齐性得到改善。进一步分析确认,ErrEval有效缓解了对低质量问题的高估问题。

关键词

引用

@article{arxiv.2601.10406,
  title  = {ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics},
  author = {Weiping Fu and Bifan Wei and Jingyi Hao and Yushun Zhang and Jian Zhang and Jiaxin Wang and Bo Li and Yu He and Lingling Zhang and Jun Liu},
  journal= {arXiv preprint arXiv:2601.10406},
  year   = {2026}
}