Machine Learning · Computer Science
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
Anjiang Wei, Jiannan Cao, Ran Li, Hongyu Chen +7
2025-09-23
Computation and Language · Computer Science
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
Shiyi Xu, Yiwen Hu, Yingqian Min, Zhipeng Chen +2
2025-06-06
Computation and Language · Computer Science
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
Alexander Zhang, Marcus Dong, Jiaheng Liu, Wei Zhang +14
2025-02-25
Artificial Intelligence · Computer Science
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
Junnan Dong, Zijin Hong, Yuanchen Bei, Feiran Huang +2
2024-10-28
Computation and Language · Computer Science
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
Zicheng Lin, Zhibin Gou, Tian Liang, Ruilin Luo +2
2024-06-04
Computation and Language · Computer Science
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth
2026-04-21
Computation and Language · Computer Science
ProBench: Benchmarking Large Language Models in Competitive Programming
Lei Yang, Renren Jin, Ling Shi, Jianxiang Peng +2
2025-03-03
Software Engineering · Computer Science
InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models
Linyi Li, Shijie Geng, Zhenwen Li, Yibo He +6
2024-11-15
Software Engineering · Computer Science
Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice
Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang +4
2026-01-01
Software Engineering · Computer Science
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong +1
2026-04-15
Computer Vision and Pattern Recognition · Computer Science
R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation
Meng-Hao Guo, Jiajun Xu, Yi Zhang, Jiaxi Song +13
2025-05-06
Computation and Language · Computer Science
OJBench: A Competition Level Code Benchmark For Large Language Models
Zhexu Wang, Yiping Liu, Yejie Wang, Wenyang He +8
2026-03-03
Computation and Language · Computer Science
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
Xiaoshuai Song, Muxi Diao, Guanting Dong, Zhengyang Wang +12
2025-03-03
Artificial Intelligence · Computer Science
CRUXEval-X: A Benchmark for Multilingual Code Reasoning, Understanding and Execution
Ruiyang Xu, Jialun Cao, Yaojie Lu, Ming Wen +5
2025-05-20
Computation and Language · Computer Science
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Xiaoxuan Wang, Ziniu Hu, Pan Lu, Yanqiao Zhu +6
2024-07-01
Computation and Language · Computer Science
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
Lingyue Fu, Huacan Chai, Shuang Luo, Kounianhua Du +12
2024-03-12
Artificial Intelligence · Computer Science
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
Nasim Borazjanizadeh, Roei Herzig, Trevor Darrell, Rogerio Feris +1
2025-09-16
Computation and Language · Computer Science
BizBench: A Quantitative Reasoning Benchmark for Business and Finance
Rik Koncel-Kedziorski, Michael Krumdick, Viet Lai, Varshini Reddy +2
2024-03-13
Artificial Intelligence · Computer Science
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu +8
2026-05-05
Computation and Language · Computer Science
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
Zijin Hong, Hao Wu, Su Dong, Junnan Dong +7
2025-08-14