中文

MinosEval:面向开放式问答的事实性与非事实性问题区分评估框架

计算与语言 2025-06-19 v1

摘要

开放式问答(QA)是评估大型语言模型(LLM)能力的关键任务。与封闭式 QA 相比,开放式问答需要更长的答案表述、更细致的推理过程以及多样化的表达方式,这使得自动评估变得既至关重要又充满挑战。传统指标如 ROUGE 和 BERTScore 难以捕捉模型响应与参考答案之间的语义相似性,因为两者的表达模式差异显著。当前的 LLM 基于评估方法,如成对或列表比较候选答案,缺乏直观的可解释性。虽然基于点评分的每个响应评分能提供一些描述,但无法跨不同问题内容进行适应。最显著的问题是,现有方法忽略了事实性问题与非事实性问题之间的区别。为此,我们提出了 \textbf{MinosEval},一种新型评估方法,首先区分开放式问题,然后针对不同问题类型采用不同评估策略。对于事实性问题,应用自适应关键点评分策略;对于非事实性问题,采用实例感知的列表排序策略。实验在多个开放式 QA 数据集上进行,包括自建数据集(包含更多候选答案以补充社区资源),表明 MinosEval 更能与人类标注一致,并提供更具可解释性的结果。

关键词

引用

@article{arxiv.2506.15215,
  title  = {MinosEval: Distinguishing Factoid and Non-Factoid for Tailored Open-Ended QA Evaluation with LLMs},
  author = {Yongqi Fan and Yating Wang and Guandong Wang and Jie Zhai and Jingping Liu and Qi Ye and Tong Ruan},
  journal= {arXiv preprint arXiv:2506.15215},
  year   = {2025}
}