中文

通过对抗编码复活饱和的 LLM 基准

机器学习 2025-02-11 v1

摘要

最近的工作表明,基准问题的小幅变更可降低 LLM 的推理和记忆能力。我们探索了两种此类变更:对问题进行配对以及增加更多答案选项,对三个基准进行测试:WMDP-bio、GPQA 和 MMLU 变体。我们发现,对于更强大的模型,这些可预测的变更会降低性能,本质上提高了基准性能上限并再次使其未饱和。我们建议,这种方法可以复活旧基准。

关键词

引用

@article{arxiv.2502.06738,
  title  = {Resurrecting saturated LLM benchmarks with adversarial encoding},
  author = {Igor Ivanov and Dmitrii Volkov},
  journal= {arXiv preprint arXiv:2502.06738},
  year   = {2025}
}