基于 Base-Rate 的 LLM 基准测试表现:消除测试策略与基准表现的混淆
计算与语言
2024-10-01 v2 人工智能
摘要
Cloze 测试是衡量大型语言模型在多个基准任务上行为的常见方法。使用 MMLU 数据集,我们展示了答案 token 之间的 base-rate probability(BRP)差异显著且会影响任务表现,即不确定时选择 A。我们发现反事实提示足以缓解 BRP 效应。BRP 效应被发现对人类所采用的测试策略产生类似效果,导致任务表现与测试能力的混淆。我们提出 Nvr-X-MMLU 任务,这是 MMLU 的一种变体,有助于消除测试能力与任务表现之间的混淆,并报告后者。
引用
@article{arxiv.2406.11634,
title = {The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performance},
author = {Kyle Moore and Jesse Roberts and Thao Pham and Oseremhen Ewaleifoh and Doug Fisher},
journal= {arXiv preprint arXiv:2406.11634},
year = {2024}
}