Computation and Language · Computer Science
KMMLU: Measuring Massive Multitask Language Understanding in Korean
Guijin Son, Hanwool Lee, Sungdong Kim, Seungone Kim +5
2024-06-07
Computation and Language · Computer Science
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
Hyeonwoo Kim, Dahyun Kim, Jihoo Kim, Sukyung Lee +2
2025-03-05
Computation and Language · Computer Science
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
Weihao Xuan, Rui Yang, Heli Qi, Qingcheng Zeng +28
2025-05-27
Computation and Language · Computer Science
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim +3
2026-04-20
Computation and Language · Computer Science
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
Yeeun Kim, Young Rok Choi, Eunkyung Choi, Jinhwan Choi +2
2024-10-14
Computation and Language · Computer Science
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
Wentian Wang, Sarthak Jain, Paul Kantor, Jacob Feldman +2
2024-10-07
Computation and Language · Computer Science
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
Chanjun Park, Hyeonwoo Kim, Dahyun Kim, Seonghwan Cho +4
2024-08-20
Computation and Language · Computer Science
CMMLU: Measuring massive multitask language understanding in Chinese
Haonan Li, Yixuan Zhang, Fajri Koto, Yifei Yang +4
2024-01-19
Computation and Language · Computer Science
LegalMidm: Use-Case-Driven Legal Domain Specialization for Korean Large Language Model
Youngjoon Jang, Chanhee Park, Hyeonseok Moon, Young-kyoung Ham +4
2026-04-29
Computation and Language · Computer Science
ArcMMLU: A Library and Information Science Benchmark for Large Language Models
Shitou Zhang, Zuchao Li, Xingshen Liu, Liming Yang +1
2023-12-01
Computation and Language · Computer Science
tinyBenchmarks: evaluating LLMs with fewer examples
Felipe Maia Polo, Lucas Weber, Leshem Choshen, Yuekai Sun +2
2024-05-28
Computation and Language · Computer Science
KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs
Donghyeon Ko, Yeguk Jin, Kyubyung Chae, Byungwook Lee +5
2025-10-22
Computation and Language · Computer Science
B\"{u}y\"{u}k Dil Modelleri i\c{c}in TR-MMLU Benchmark{\i}: Performans De\u{g}erlendirmesi, Zorluklar ve \.{I}yile\c{s}tirme F{\i}rsatlar{\i}
M. Ali Bayram, Ali Arda Fincan, Ahmet Semih Gümüş, Banu Diri +2
2025-08-19
Computation and Language · Computer Science
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
ChangSu Choi, Yongbin Jeong, Seoyoon Park, InHo Won +10
2024-03-22
Computation and Language · Computer Science
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni +13
2024-11-07
Artificial Intelligence · Computer Science
LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
Antoine Peyronnet, Fabian Gloeckle, Amaury Hayat
2026-03-02
Computation and Language · Computer Science
ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts
Dongwon Noh, Donghyeok Koh, Junghun Yuk, Gyuwan Kim +3
2025-10-17
Computation and Language · Computer Science
Mi:dm 2.0 Korea-centric Bilingual Language Models
Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu +62
2026-01-15
Computation and Language · Computer Science
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
Sungmok Jung, Yeonkyoung So, Joonhak Lee, Sangho Kim +2
2026-01-09
Computation and Language · Computer Science
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
Dongjun Kim, Chanhee Park, Chanjun Park, Heuiseok Lim
2025-10-20
Computation and Language · Computer Science
MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
Dongyi Yi, Guibo Zhu, Chenglin Ding, Zongshu Li +2
2025-01-29
Software Engineering · Computer Science
CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs
Dung Nguyen Manh, Thang Phan Chau, Nam Le Hai, Thong T. Doan +3
2025-04-10