通过对抗编码复活饱和的 LLM 基准
机器学习
2025-02-11 v1
摘要
最近的工作表明,基准问题的小幅变更可降低 LLM 的推理和记忆能力。我们探索了两种此类变更:对问题进行配对以及增加更多答案选项,对三个基准进行测试:WMDP-bio、GPQA 和 MMLU 变体。我们发现,对于更强大的模型,这些可预测的变更会降低性能,本质上提高了基准性能上限并再次使其未饱和。我们建议,这种方法可以复活旧基准。
引用
@article{arxiv.2502.06738,
title = {Resurrecting saturated LLM benchmarks with adversarial encoding},
author = {Igor Ivanov and Dmitrii Volkov},
journal= {arXiv preprint arXiv:2502.06738},
year = {2025}
}