Computation and Language · Computer Science
Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding
Yeonkyoung So, Gyuseong Lee, Sungmok Jung, Joonhak Lee +3
2026-04-21
Computation and Language · Computer Science
KMMLU: Measuring Massive Multitask Language Understanding in Korean
Guijin Son, Hanwool Lee, Sungdong Kim, Seungone Kim +5
2024-06-07
Computation and Language · Computer Science
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo, Minho Jang +3
2026-04-23
Computation and Language · Computer Science
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
Guijin Son, Hanwool Lee, Suwan Kim, Huiseo Kim +5
2024-03-21
Computation and Language · Computer Science
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
Jinpyo Kim, Gyeongje Cho, Chanwoo Park, Jongwon Park +3
2025-06-30
Computation and Language · Computer Science
Developing a Pragmatic Benchmark for Assessing Korean Legal Language Understanding in Large Language Models
Yeeun Kim, Young Rok Choi, Eunkyung Choi, Jinhwan Choi +2
2024-10-14
Computation and Language · Computer Science
From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
Seokhee Hong, Sunkyoung Kim, Guijin Son, Soyeon Kim +2
2025-07-21
Computation and Language · Computer Science
This is not a Dataset: A Large Negation Benchmark to Challenge Large Language Models
Iker García-Ferrero, Begoña Altuna, Javier Álvez, Itziar Gonzalez-Dios +1
2023-10-25
Computer Vision and Pattern Recognition · Computer Science
Vision-Language Models Do Not Understand Negation
Kumail Alhamoud, Shaden Alshammari, Yonglong Tian, Guohao Li +3
2025-05-14
Computation and Language · Computer Science
KULTURE Bench: A Benchmark for Assessing Language Model in Korean Cultural Context
Xiaonan Wang, Jinyoung Yeo, Joon-Ho Lim, Hansaem Kim
2024-12-11
Computation and Language · Computer Science
KLUE: Korean Language Understanding Evaluation
Sungjoon Park, Jihyung Moon, Sungdong Kim, Won Ik Cho +27
2021-11-03
Computation and Language · Computer Science
Polishing Every Facet of the GEM: Testing Linguistic Competence of LLMs and Humans in Korean
SungHo Kim, Nayeon Kim, Taehee Jeon, SangKeun Lee
2025-06-03
Computation and Language · Computer Science
KOBEST: Korean Balanced Evaluation of Significant Tasks
Dohyeong Kim, Myeongjun Jang, Deuk Sin Kwon, Eric Davis
2022-04-12
Computation and Language · Computer Science
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee +1
2026-05-28
Computation and Language · Computer Science
Language models are not naysayers: An analysis of language models on negation benchmarks
Thinh Hung Truong, Timothy Baldwin, Karin Verspoor, Trevor Cohn
2023-06-16
Computation and Language · Computer Science
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
Chanwoo Park, Suyoung Park, JiA Kang, Jongyeon Park +5
2025-10-29
Computation and Language · Computer Science
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
Chanjun Park, Hyeonwoo Kim, Dahyun Kim, Seonghwan Cho +4
2024-08-20
Computation and Language · Computer Science
ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic Contexts
Dongwon Noh, Donghyeok Koh, Junghun Yuk, Gyuwan Kim +3
2025-10-17
Computation and Language · Computer Science
Commonsense Knowledge with Negation: A Resource to Enhance Negation Understanding
Zijie Wang, MohammadHossein Rezaei, Farzana Rashid, Eduardo Blanco
2026-04-23
Computation and Language · Computer Science
KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge
Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar +1
2026-02-24
Computation and Language · Computer Science
Negation: A Pink Elephant in the Large Language Models' Room?
Tereza Vrabcová, Marek Kadlčík, Petr Sojka, Michal Štefánik +1
2025-06-04
Computation and Language · Computer Science
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim +3
2026-04-20