Machine Learning · Computer Science
Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures
Yu He, Yingxi Li, Colin White, Ellen Vitercik
2026-02-12
Artificial Intelligence · Computer Science
Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering
Lars-Peter Meyer, Johannes Frey, Kurt Junghanns, Felix Brei +3
2023-09-01
Computation and Language · Computer Science
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
Elan Markowitz, Krupa Galiya, Greg Ver Steeg, Aram Galstyan
2025-04-10
Artificial Intelligence · Computer Science
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat
2026-03-02
Computation and Language · Computer Science
DiscoveryBench: Towards Data-Driven Discovery with Large Language Models
Bodhisattwa Prasad Majumder, Harshit Surana, Dhruv Agarwal, Bhavana Dalvi Mishra +6
2024-07-03
Artificial Intelligence · Computer Science
Rethinking and Benchmarking Large Language Models for Graph Reasoning
Yuwei Hu, Xinyi Huang, Zhewei Wei, Yongchao Liu +1
2025-10-03
Artificial Intelligence · Computer Science
TQA-Bench: Evaluating LLMs for Multi-Table Question Answering with Scalable Context and Symbolic Extension
Zipeng Qiu, You Peng, Guangxin He, Binhang Yuan +1
2024-12-02
Computation and Language · Computer Science
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
Xianjie Wu, Jian Yang, Linzheng Chai, Ge Zhang +9
2025-03-19
Machine Learning · Computer Science
GLBench: A Comprehensive Benchmark for Graph with Large Language Models
Yuhan Li, Peisong Wang, Xiao Zhu, Aochuan Chen +4
2024-10-30
Machine Learning · Computer Science
Are Large-Language Models Graph Algorithmic Reasoners?
Alexander K Taylor, Anthony Cuturrufo, Vishal Yathish, Mingyu Derek Ma +1
2024-10-31
Computation and Language · Computer Science
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
Hanyu Li, Haoyu Liu, Tingyu Zhu, Tianyu Guo +3
2025-06-09
Computation and Language · Computer Science
FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models
Dmitry Stanishevskii, Nini Kamkia, Alexey Khoroshilov, Dmitry Zmitrovich +3
2026-05-25
Computation and Language · Computer Science
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye
2026-05-01
Artificial Intelligence · Computer Science
LLM-KG-Bench 3.0: A Compass for SemanticTechnology Capabilities in the Ocean of LLMs
Lars-Peter Meyer, Johannes Frey, Desiree Heim, Felix Brei +3
2025-06-03
Artificial Intelligence · Computer Science
CLR-Bench: Evaluating Large Language Models in College-level Reasoning
Junnan Dong, Zijin Hong, Yuanchen Bei, Feiran Huang +2
2024-10-28
Artificial Intelligence · Computer Science
INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
Bintao Tang, Xin Yang, Yuhao Wang, Zixuan Qiu +2
2025-07-30
Computation and Language · Computer Science
Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs
Bowen Jin, Chulin Xie, Jiawei Zhang, Kashob Kumar Roy +7
2024-10-04
Computation and Language · Computer Science
A Graph Talks, But Who's Listening? Rethinking Evaluations for Graph-Language Models
Soham Petkar, Hari Aakash K, Anirudh Vempati, Akshit Sinha +2
2025-08-29
Artificial Intelligence · Computer Science
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
Yue Yang, MingKang Chen, Qihua Liu, Mengkang Hu +8
2025-09-30
Computation and Language · Computer Science
Table Meets LLM: Can Large Language Models Understand Structured Table Data? A Benchmark and Empirical Study
Yuan Sui, Mengyu Zhou, Mingjie Zhou, Shi Han +1
2024-07-18
Computation and Language · Computer Science
Bench4KE: Benchmarking Automated Competency Question Generation
Anna Sofia Lippolis, Minh Davide Ragagni, Paolo Ciancarini, Andrea Giovanni Nuzzolese +1
2025-12-10
Computation and Language · Computer Science
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth
2026-04-21