Computation and Language · Computer Science
XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating Cross-lingual Generalization
Junjie Hu, Sebastian Ruder, Aditya Siddhant, Graham Neubig +2
2020-09-07
Computation and Language · Computer Science
DuReader_robust: A Chinese Dataset Towards Evaluating Robustness and Generalization of Machine Reading Comprehension in Real-World Applications
Hongxuan Tang, Hongyu Li, Jing Liu, Yu Hong +2
2021-07-22
Computer Vision and Pattern Recognition · Computer Science
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
Hongyu Wang, Jiayu Xu, Senwei Xie, Ruiping Wang +5
2025-04-28
Computation and Language · Computer Science
mMARCO: A Multilingual Version of the MS MARCO Passage Ranking Dataset
Luiz Bonifacio, Vitor Jeronymo, Hugo Queiroz Abonizio, Israel Campiotti +3
2022-08-18
Computation and Language · Computer Science
XTREME-R: Towards More Challenging and Nuanced Multilingual Evaluation
Sebastian Ruder, Noah Constant, Jan Botha, Aditya Siddhant +7
2021-10-08
Computation and Language · Computer Science
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
Xu Huang, Wenhao Zhu, Hanxu Hu, Conghui He +3
2025-04-22
Computation and Language · Computer Science
RETSim: Resilient and Efficient Text Similarity
Marina Zhang, Owen Vallis, Aysegul Bumin, Tanay Vakharia +1
2023-11-30
Computation and Language · Computer Science
Towards Robust Universal Information Extraction: Benchmark, Evaluation, and Solution
Jizhao Zhu, Akang Shi, Zixuan Li, Long Bai +3
2025-03-06
Computation and Language · Computer Science
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
Junjie Ye, Yilong Wu, Songyang Gao, Caishuang Huang +6
2024-09-24
Computation and Language · Computer Science
An Understanding-Oriented Robust Machine Reading Comprehension Model
Feiliang Ren, Yongkang Liu, Bochao Li, Shilei Liu +4
2022-07-04
Computation and Language · Computer Science
Many-to-English Machine Translation Tools, Data, and Pretrained Models
Thamme Gowda, Zhao Zhang, Chris A Mattmann, Jonathan May
2024-10-24
Computation and Language · Computer Science
REBUS: A Robust Evaluation Benchmark of Understanding Symbols
Andrew Gritsevskiy, Arjun Panickssery, Aaron Kirtland, Derik Kauffman +6
2024-06-05
Computation and Language · Computer Science
TextFlint: Unified Multilingual Robustness Evaluation Toolkit for Natural Language Processing
Tao Gui, Xiao Wang, Qi Zhang, Qin Liu +30
2021-05-06
Information Retrieval · Computer Science
NeuCLIRBench: A Modern Evaluation Collection for Monolingual, Cross-Language, and Multilingual Information Retrieval
Dawn Lawrie, James Mayfield, Eugene Yang, Andrew Yates +5
2025-11-19
Computation and Language · Computer Science
Benchmarking Robustness of Machine Reading Comprehension Models
Chenglei Si, Ziqing Yang, Yiming Cui, Wentao Ma +2
2021-05-27
Computation and Language · Computer Science
Learning Robust and Multilingual Speech Representations
Kazuya Kawakami, Luyu Wang, Chris Dyer, Phil Blunsom +1
2020-01-31
Computation and Language · Computer Science
Robustification of Multilingual Language Models to Real-world Noise in Crosslingual Zero-shot Settings with Robust Contrastive Pretraining
Asa Cooper Stickland, Sailik Sengupta, Jason Krone, Saab Mansour +1
2023-02-14
Computation and Language · Computer Science
Findings of the First Shared Task on Machine Translation Robustness
Xian Li, Paul Michel, Antonios Anastasopoulos, Yonatan Belinkov +6
2019-07-05
Information Retrieval · Computer Science
mFollowIR: a Multilingual Benchmark for Instruction Following in Retrieval
Orion Weller, Benjamin Chang, Eugene Yang, Mahsa Yarmohammadi +6
2025-02-03
Computation and Language · Computer Science
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee +1
2026-03-24
Information Retrieval · Computer Science
Boosting Data Utilization for Multilingual Dense Retrieval
Chao Huang, Fengran Mo, Yufeng Chen, Changhao Guan +4
2025-09-12
Computation and Language · Computer Science
M-RewardBench: Evaluating Reward Models in Multilingual Settings
Srishti Gureja, Lester James V. Miranda, Shayekh Bin Islam, Rishabh Maheshwary +6
2025-05-21