Computation and Language · Computer Science
RuBLiMP: Russian Benchmark of Linguistic Minimal Pairs
Ekaterina Taktasheva, Maxim Bazhukov, Kirill Koncha, Alena Fenogenova +2
2024-10-03
Computation and Language · Computer Science
BLiMP: The Benchmark of Linguistic Minimal Pairs for English
Alex Warstadt, Alicia Parrish, Haokun Liu, Anhad Mohananey +3
2023-02-15
Computation and Language · Computer Science
Irish-BLiMP: A Linguistic Benchmark for Evaluating Human and Language Model Performance in a Low-Resource Setting
Josh McGiff, Khanh-Tung Tran, William Mulcahy, Dáibhidh Ó Luinín +6
2025-10-27
Computation and Language · Computer Science
TurBLiMP: A Turkish Benchmark of Linguistic Minimal Pairs
Ezgi Başar, Francesca Padovani, Jaap Jumelet, Arianna Bisazza
2025-12-03
Computation and Language · Computer Science
QFrBLiMP: a Quebec-French Benchmark of Linguistic Minimal Pairs
David Beauchemin, Pier-Luc Veilleux, Johanna-Pascale Roy, Richard Khoury
2026-01-06
Computation and Language · Computer Science
UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu
Farah Adeeba, Brian Dillon, Hassan Sajjad, Rajesh Bhatt
2025-08-05
Computation and Language · Computer Science
CLiMP: A Benchmark for Chinese Language Model Evaluation
Beilei Xiang, Changbing Yang, Yu Li, Alex Warstadt +1
2021-01-28
Computation and Language · Computer Science
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
Wenhan Han, Yifan Zhang, Zhixun Chen, Binbin Liu +6
2025-06-25
Computation and Language · Computer Science
Linguistic Minimal Pairs Elicit Linguistic Similarity in Large Language Models
Xinyu Zhou, Delong Chen, Samuel Cahyawijaya, Xufeng Duan +1
2024-12-16
Computation and Language · Computer Science
A Systematic Assessment of Language Models with Linguistic Minimal Pairs in Chinese
Yikang Liu, Yeting Shen, Hongao Zhu, Lilong Xu +8
2025-12-09
Computation and Language · Computer Science
XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs
Linyang He, Ercong Nie, Sukru Samet Dindar, Arsalan Firoozi +9
2025-02-28
Computation and Language · Computer Science
Goldfish: Monolingual Language Models for 350 Languages
Tyler A. Chang, Catherine Arnett, Zhuowen Tu, Benjamin K. Bergen
2026-03-09
Computation and Language · Computer Science
BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models
Yuan Gao, Suchir Salhan, Andrew Caines, Paula Buttery +1
2025-10-23
Computation and Language · Computer Science
SLING: Sino Linguistic Evaluation of Large Language Models
Yixiao Song, Kalpesh Krishna, Rajesh Bhatt, Mohit Iyyer
2022-10-24
Computation and Language · Computer Science
Multi-SimLex: A Large-Scale Evaluation of Multilingual and Cross-Lingual Lexical Semantic Similarity
Ivan Vulić, Simon Baker, Edoardo Maria Ponti, Ulla Petti +8
2020-03-11
Computation and Language · Computer Science
XIFBench: Evaluating Large Language Models on Multilingual Instruction Following
Zhenyu Li, Kehai Chen, Yunfei Long, Xuefeng Bai +4
2025-11-04
Computation and Language · Computer Science
MASSIVE: A 1M-Example Multilingual Natural Language Understanding Dataset with 51 Typologically-Diverse Languages
Jack FitzGerald, Christopher Hench, Charith Peris, Scott Mackie +12
2022-06-20
Computation and Language · Computer Science
INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge
Angelika Romanou, Negar Foroutan, Anna Sotnikova, Zeming Chen +55
2024-12-02
Computation and Language · Computer Science
A Survey on Benchmarks of Multimodal Large Language Models
Jian Li, Weiheng Lu, Hao Fei, Meng Luo +10
2024-09-09