Artificial Intelligence · Computer Science
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat
2026-03-02
Computation and Language · Computer Science
Don't Make Your LLM an Evaluation Benchmark Cheater
Kun Zhou, Yutao Zhu, Zhipeng Chen, Wentong Chen +5
2023-11-06
Artificial Intelligence · Computer Science
RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
Jie Zhang, Cezara Petrui, Kristina Nikolić, Florian Tramèr
2025-10-21
Computation and Language · Computer Science
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
Colin White, Samuel Dooley, Manley Roberts, Arka Pal +14
2025-04-22
Computation and Language · Computer Science
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng +5
2025-06-17
Computation and Language · Computer Science
How Predictable Are Large Language Model Capabilities? A Case Study on BIG-bench
Qinyuan Ye, Harvey Yiyun Fu, Xiang Ren, Robin Jia
2023-11-01
Computation and Language · Computer Science
RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
Ziqian Zhang, Xingjian Hu, Yue Huang, Kai Zhang +7
2026-02-16
Computation and Language · Computer Science
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
Zijin Hong, Hao Wu, Su Dong, Junnan Dong +7
2025-08-14
Computation and Language · Computer Science
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang +7
2025-11-13
Computation and Language · Computer Science
Ranking Large Language Models without Ground Truth
Amit Dhurandhar, Rahul Nair, Moninder Singh, Elizabeth Daly +1
2024-06-11
Machine Learning · Computer Science
InductionBench: LLMs Fail in the Simplest Complexity Class
Wenyue Hua, Tyler Wong, Sun Fei, Liangming Pan +2
2025-05-15
Artificial Intelligence · Computer Science
INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
Bintao Tang, Xin Yang, Yuhao Wang, Zixuan Qiu +2
2025-07-30
Computation and Language · Computer Science
IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi +29
2025-10-01
Computation and Language · Computer Science
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Xiaoxuan Wang, Ziniu Hu, Pan Lu, Yanqiao Zhu +6
2024-07-01
Artificial Intelligence · Computer Science
AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions
Polina Kirichenko, Mark Ibrahim, Kamalika Chaudhuri, Samuel J. Bell
2025-06-11
Computation and Language · Computer Science
CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models
Yuefei Chen, Vivek K. Singh, Jing Ma, Ruixiang Tang
2026-04-14
Software Engineering · Computer Science
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
Linyi Li, Shijie Geng, Zhenwen Li, Yibo He +6
2024-11-15
Computer Vision and Pattern Recognition · Computer Science
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta +30
2025-03-07
Artificial Intelligence · Computer Science
Benchmarking Defeasible Reasoning with Large Language Models -- Initial Experiments and Future Directions
Ilias Tachmazidis, Sotiris Batsakis, Grigoris Antoniou
2024-10-17