中文

LLM 奥林匹克:模型评估为何需要封闭考试

人工智能 2026-03-25 v1 计算与语言

摘要

基准测试和排行榜是 NLP 最常 communicates 进度的方式,但在大语言模型时代它们越来越容易被误读。分数可能反映出对基准测试的追逐、隐藏的评估选择,或是意外暴露于测试内容——这仅仅是能力的表现。封闭式基准测试延缓了其中一些问题,但减少了透明度,使得社区更难从结果中学习。我们主张一种互补实践:一种奥林匹克式的评估活动,其中问题在评估前保持封闭,提交物提前冻结,并通过统一的标准化测试环境运行。评分后,发布完整的任务集合和评估代码,以便结果可以被复现和审计。这种设计旨在使强大的性能更难被“制造”,更容易被信任。

关键词

引用

@article{arxiv.2603.23292,
  title  = {LLM Olympiad: Why Model Evaluation Needs a Sealed Exam},
  author = {Jan Christian Blaise Cruz and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2603.23292},
  year   = {2026}
}