Computation and Language · Computer Science
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth
2026-04-21
Artificial Intelligence · Computer Science
FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
Nikil Ravi, Kexing Ying, Vasilii Nesterov, Rayan Krishnan +4
2026-03-31
Computation and Language · Computer Science
Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties
Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh +4
2026-02-10
Computation and Language · Computer Science
IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi +29
2025-10-01
Computation and Language · Computer Science
TaskBench: Benchmarking Large Language Models for Task Automation
Yongliang Shen, Kaitao Song, Xu Tan, Wenqi Zhang +5
2024-11-04
Computation and Language · Computer Science
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye
2026-05-01
Computation and Language · Computer Science
RExBench: Can coding agents autonomously implement AI research extensions?
Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin +2
2026-04-23
Computation and Language · Computer Science
ClawBench: Can AI Agents Complete Everyday Online Tasks?
Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du +17
2026-04-10
Computation and Language · Computer Science
BizBench: A Quantitative Reasoning Benchmark for Business and Finance
Rik Koncel-Kedziorski, Michael Krumdick, Viet Lai, Varshini Reddy +2
2024-03-13
Computation and Language · Computer Science
MotiveBench: How Far Are We From Human-Like Motivational Reasoning in Large Language Models?
Xixian Yong, Jianxun Lian, Xiaoyuan Yi, Xiao Zhou +1
2025-06-17
Artificial Intelligence · Computer Science
INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
Bintao Tang, Xin Yang, Yuhao Wang, Zixuan Qiu +2
2025-07-30
Computation and Language · Computer Science
Computational Reasoning of Large Language Models
Haitao Wu, Zongbo Han, Joey Tianyi Zhou, Huaxi Huang +1
2025-05-20
Machine Learning · Computer Science
ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities
Ezra Karger, Houtan Bastani, Chen Yueh-Han, Zachary Jacobs +3
2025-03-03
Computation and Language · Computer Science
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
Gang Hu, Yating Chen, Haiyan Ding, Wang Gao +4
2026-04-23
Machine Learning · Computer Science
SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?
Sy-Tuyen Ho, Minghui Liu, Huy Nghiem, Furong Huang
2026-05-29
Artificial Intelligence · Computer Science
ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding
Xinbang Dai, Huikang Hu, Yongrui Chen, Jiaqi Li +5
2026-01-08
Computation and Language · Computer Science
Large Language Models as Tax Attorneys: A Case Study in Legal Capabilities Emergence
John J. Nay, David Karamardian, Sarah B. Lawsky, Wenting Tao +5
2023-06-13
Artificial Intelligence · Computer Science
Mapping AI Benchmark Data to Quantitative Risk Estimates Through Expert Elicitation
Malcolm Murray, Henry Papadatos, Otter Quarks, Pierre-François Gimenez +1
2025-03-11
Machine Learning · Computer Science
InductionBench: LLMs Fail in the Simplest Complexity Class
Wenyue Hua, Tyler Wong, Sun Fei, Liangming Pan +2
2025-05-15
Computation and Language · Computer Science
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
Shashidhar Reddy Javaji, Yupeng Cao, Haohang Li, Yangyang Yu +2
2025-06-11
Artificial Intelligence · Computer Science
PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models
Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian +6
2026-05-21
Statistical Finance · Quantitative Finance
Towards Competent AI for Fundamental Analysis in Finance: A Benchmark Dataset and Evaluation
Zonghan Wu, Congyuan Zou, Junlin Wang, Chenhan Wang +2
2025-11-11