中文

ThinkBench:用于鲁棒大语言模型推理的动态准外分布评估

计算与语言 2025-02-25 v1

摘要

评估大型语言模型 (LLM) 面临数据污染和正确答案泄露等显著挑战。为解决这些挑战,我们引入 ThinkBench,一个 novel 的评估框架,用于 robustly 评估 LLM 的推理能力。ThinkBench 提出一种用于构建准外分布 (OOD) 数据集的动态数据生成方法,并提供包含 2,912 个样本的 OOD 数据集。ThinkBench 统一了推理模型和非推理模型的评估。我们在相同的实验条件下评估了 16 个 LLM 和 4 个 PRM,表明大多数 LLM 的性能远远不够稳健,且面临一定程度的数据泄露。通过动态生成 OOD 数据集,ThinkBench 有效提供了可靠的 LLM 评估,减少数据污染的影响。

关键词

引用

@article{arxiv.2502.16268,
  title  = {ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning},
  author = {Shulin Huang and Linyi Yang and Yan Song and Shuang Chen and Leyang Cui and Ziyu Wan and Qingcheng Zeng and Ying Wen and Kun Shao and Weinan Zhang and Jun Wang and Yue Zhang},
  journal= {arXiv preprint arXiv:2502.16268},
  year   = {2025}
}