中文

MCQ 任务中答案波动背景下的指标评估协议

人工智能 2025-07-22 v1

摘要

使用多选题 (MCQs) 已成为高效评估大语言模型能力的标准方法。可以采用多种指标。然而,前期研究尚未对这些指标进行彻底的评估。同时,MCQs 评估受到答案波动的影响:模型在提示词轻微变化时会产生不同结果。我们提出一种指标评估协议,通过分析它们与波动率之间的关联以及原始性能来评估评估方法。我们的结果表明,现有指标与答案变化存在强烈关联,即使在没有任何额外提示变量的情况下计算亦是如此。一种新型指标——最坏准确率 (worst accuracy) 在该协议中表现出最高的关联性。

关键词

引用

@article{arxiv.2507.15581,
  title  = {Metric assessment protocol in the context of answer fluctuation on MCQ tasks},
  author = {Ekaterina Goliakova and Xavier Renard and Marie-Jeanne Lesot and Thibault Laugel and Christophe Marsala and Marcin Detyniecki},
  journal= {arXiv preprint arXiv:2507.15581},
  year   = {2025}
}