Computation and Language · Computer Science
BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak +5
2026-05-28
Computation and Language · Computer Science
LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models
Neel Guha, Julian Nyarko, Daniel E. Ho, Christopher Ré +36
2023-08-23
Computation and Language · Computer Science
One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support
Ronja Stern, Vishvaksenan Rasiah, Veton Matoshi, Srinanda Brügger Bose +4
2024-08-22
Computation and Language · Computer Science
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
Xu Huang, Wenhao Zhu, Hanxu Hu, Conghui He +3
2025-04-22
Artificial Intelligence · Computer Science
Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization
Hangyi Jia, Yuxi Qian, Hanwen Tong, Xinhui Wu +2
2025-09-12
Computation and Language · Computer Science
Enterprise Benchmarks for Large Language Model Evaluation
Bing Zhang, Mikio Takeuchi, Ryo Kawahara, Shubhi Asthana +4
2024-10-18
Machine Learning · Computer Science
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
Natasha Butt, Varun Chandrasekaran, Neel Joshi, Besmira Nushi +1
2025-10-08
Computation and Language · Computer Science
LawBench: Benchmarking Legal Knowledge of Large Language Models
Zhiwei Fei, Xiaoyu Shen, Dawei Zhu, Fengzhe Zhou +5
2023-09-29
Computation and Language · Computer Science
BERGEN: A Benchmarking Library for Retrieval-Augmented Generation
David Rau, Hervé Déjean, Nadezhda Chirkova, Thibault Formal +3
2024-07-02
Computation and Language · Computer Science
GradeLegal: Automated Grading for German Legal Cases
Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer +1
2026-05-21
Computation and Language · Computer Science
BenchBench: Benchmarking Automated Benchmark Generation
Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu +1
2026-03-24
Software Engineering · Computer Science
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
Titouan Duston, Shuo Xin, Yang Sun, Daoguang Zan +25
2025-12-29
Computation and Language · Computer Science
DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems
Anni Zou, Wenhao Yu, Hongming Zhang, Kaixin Ma +4
2024-07-16
Artificial Intelligence · Computer Science
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu +8
2026-05-05
Artificial Intelligence · Computer Science
Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering
Lars-Peter Meyer, Johannes Frey, Kurt Junghanns, Felix Brei +3
2023-09-01
Computation and Language · Computer Science
LEXam: Benchmarking Legal Reasoning on 340 Law Exams
Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian +13
2026-04-03
Computation and Language · Computer Science
FELM: Benchmarking Factuality Evaluation of Large Language Models
Shiqi Chen, Yiran Zhao, Jinghan Zhang, I-Chun Chern +3
2023-11-29
Software Engineering · Computer Science
FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation
Hongda Zhu, Yiwen Zhang, Bing Zhao, Jingzhe Ding +5
2025-06-19
Computation and Language · Computer Science
LLM-Powered Benchmark Factory: Reliable, Generic, and Efficient
Peiwen Yuan, Shaoxiong Feng, Yiwei Li, Xinglin Wang +6
2025-02-05
Artificial Intelligence · Computer Science
ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
Cheng Qian, Hongyi Du, Hongru Wang, Xiusi Chen +5
2025-05-22
Software Engineering · Computer Science
ArchBench: Benchmarking Generative-AI for Software Architecture Tasks
Bassam Adnan, Aviral Gupta, Sreemaee Akshathala, Karthik Vaidhyanathan
2026-03-19
Machine Learning · Computer Science
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
Eunsu Kim, Haneul Yoo, Guijin Son, Hitesh Patel +2
2025-06-03
Computation and Language · Computer Science
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
Anna Sokol, Elizabeth Daly, Michael Hind, David Piorkowski +3
2025-06-04
Artificial Intelligence · Computer Science
INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
Bintao Tang, Xin Yang, Yuhao Wang, Zixuan Qiu +2
2025-07-30