中文

通过一致性评估与修改后的选项提升多选基准的得分可靠性

计算与语言 2025-12-01 v1 人工智能

摘要

本文提出了一致性再平衡准确度(Consistency-Rebalanced Accuracy, CoRA)指标,用于改进基于大型语言模型(LLM)在多选题(Multiple Choice, MC)基准测试中计算得分的可靠性。我们的指标探索了 LLM 对响应的一致性,通过利用合成生成的带有修改后选项的问题来实现。CoRA 基于两个中间分数,即最小一致性准确度(Bare-Minimum-Consistency Accuracy, BMCA)和一致性指数(Consistency Index, CI),通过调整多选题回答(Multiple-Choice Question Answering, MCQA)得分,以更好地反映 LLM 一致性水平。我们在不同基准测试中进行了评估,不仅展示了即使 LLM 在高 MCQA 得分时也可能呈现低响应一致性,而且 CoRA 能够成功放大不一致模型的得分。

关键词

引用

@article{arxiv.2511.21860,
  title  = {Improving Score Reliability of Multiple Choice Benchmarks with Consistency Evaluation and Altered Answer Choices},
  author = {Paulo Cavalin and Cassia Sanctos and Marcelo Grave and Claudio Pinhanez and Yago Primerano},
  journal= {arXiv preprint arXiv:2511.21860},
  year   = {2025}
}