中文

将多选项评估边界推向一百选项

计算与语言 2026-04-17 v1

摘要

多选项评估广泛用于基准测试大型语言模型,但在低选项设置下可能因捷径策略而维持接近天花板的准确率,从而掩盖真实能力。因此,我们提出了一种大规模选项评估协议,将候选集规模扩展到一百个选项,从而显著降低机会性能的影响。我们将此框架应用于韩语正字错误检测任务,其中模型必须从大量候选项中挑选出唯一的错误句子。通过固定目标并反复抽样和洗牌,我们获得稳定的估计,同时将内容驱动的错误与位置性 artifacts 分离开来。在各种实验中,结果表明,低选项设置下的优异性能可能高估模型能力。在密集干扰的高 NN 情况下,这种优势常常减弱,揭示了常规基准测试倾向于掩盖的差距。我们确定了两种错误模式:语义混淆和在不确定时对早期选项的位置偏置。为隔离上下文长度的影响,我们进行了受控填充和长度匹配的测试,这表明瓶颈主要在于候选人排序而非上下文长度。总而言之,这些发现支持大规模选项评估作为一种通用的框架,用于在极端干扰密度下的模型可靠性压力测试,超越低选项基准测试所能揭示的范围。

关键词

引用

@article{arxiv.2604.14634,
  title  = {Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options},
  author = {Nahyun Lee and Guijin Son},
  journal= {arXiv preprint arXiv:2604.14634},
  year   = {2026}
}