中文

作弊基准:空模型在自动 LLM 基准测试中实现高胜率

计算与语言 2025-03-04 v2 人工智能 密码学与安全 机器学习

摘要

自动 LLM 基准测试(如 AlpacaEval 2.0、Arena-Hard-Auto 和 MT-Bench)因其成本效益高和可扩展性,已成为评估语言模型的热门选择。获取这些基准测试中高胜率显著提升新发布语言模型的宣传影响力。这一宣传效应可能激励作弊行为,例如操控模型输出长度或风格以获取高胜率,尽管已有多种机制用于控制长度和分离风格以降低可作弊性。然而,我们展示,即使是一个“空模型”(始终输出与输入指令无关的常数响应),也能作弊通过自动基准测试并实现顶级排名:在 AlpacaEval 2.0 上实现 86.5% 的 LC 胜率;在 Arena-Hard-Auto 上得分 83.0;在 MT-Bench 上得分 9.55。此外,所设计的作弊输出具有可迁移性,因为我们假设这些基准测试的指令(例如 AlpacaEval 2.0 的 805 个样本)是私有的,无法访问。尽管我们的实验主要是概念验证,但对手可能利用 LLM 生成更隐蔽的作弊响应,未经道德的获益于高胜率和宣传影响力。我们的发现呼吁发展反作弊机制,以实现可靠的自动基准测试。代码地址:https://github.com/sail-sg/Cheating-LLM-Benchmarks

关键词

引用

@article{arxiv.2410.07137,
  title  = {Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates},
  author = {Xiaosen Zheng and Tianyu Pang and Chao Du and Qian Liu and Jing Jiang and Min Lin},
  journal= {arXiv preprint arXiv:2410.07137},
  year   = {2025}
}

备注

ICLR 2025 (Oral)