Computation and Language · Computer Science
LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models
Neel Guha, Julian Nyarko, Daniel E. Ho, Christopher Ré +36
2023-08-23
Computation and Language · Computer Science
LEXam: Benchmarking Legal Reasoning on 340 Law Exams
Yu Fan, Jingwei Ni, Jakob Merane, Yang Tian +13
2026-04-03
Computation and Language · Computer Science
ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts
Dongwon Noh, Donghyeok Koh, Junghun Yuk, Gyuwan Kim +3
2025-10-17
Computation and Language · Computer Science
LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation
Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha +7
2025-10-09
Computation and Language · Computer Science
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song +26
2026-01-29
Computation and Language · Computer Science
LawBench: Benchmarking Legal Knowledge of Large Language Models
Zhiwei Fei, Xiaoyu Shen, Dawei Zhu, Fengzhe Zhou +5
2023-09-29
Computation and Language · Computer Science
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
Zhilin Wang, Jaehun Jung, Ximing Lu, Shizhe Diao +6
2026-05-19
Artificial Intelligence · Computer Science
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat
2026-03-02
Computation and Language · Computer Science
GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek
Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis +5
2026-03-31
Computation and Language · Computer Science
No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding
Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner +1
2026-04-03
Computation and Language · Computer Science
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
Shuang Zhou, Wenya Xie, Jiaxi Li, Zaifu Zhan +15
2025-07-11
Computation and Language · Computer Science
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás +5
2026-05-12
Computation and Language · Computer Science
DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems
Anni Zou, Wenhao Yu, Hongming Zhang, Kaixin Ma +4
2024-07-16
Artificial Intelligence · Computer Science
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng +35
2026-04-22
Artificial Intelligence · Computer Science
JudgeBench: A Benchmark for Evaluating LLM-based Judges
Sijun Tan, Siyuan Zhuang, Kyle Montgomery, William Y. Tang +4
2025-04-08
Computation and Language · Computer Science
One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support
Ronja Stern, Vishvaksenan Rasiah, Veton Matoshi, Srinanda Brügger Bose +4
2024-08-22
Computation and Language · Computer Science
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
Tu Anh Dinh, Carlos Mullov, Leonard Bärmann, Zhaolin Li +14
2024-10-03
Computation and Language · Computer Science
MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models
Yan Cai, Linlin Wang, Ye Wang, Gerard de Melo +3
2023-12-21
Computation and Language · Computer Science
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth
2026-04-21
Computation and Language · Computer Science
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
Zicheng Lin, Zhibin Gou, Tian Liang, Ruilin Luo +2
2024-06-04
Computation and Language · Computer Science
RUST-BENCH: Benchmarking LLM Reasoning on Unstructured Text within Structured Tables
Nikhil Abhyankar, Purvi Chaurasia, Sanchit Kabra, Ananya Srivastava +2
2025-11-07
Artificial Intelligence · Computer Science
WritingBench: A Comprehensive Benchmark for Generative Writing
Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li +7
2025-12-01