IRLBench:面向开放式 LLM 推理评估的多模态、文化关联的并列爱尔兰-英语基准
计算与语言
2025-05-21 v1 人工智能
摘要
近期大型语言模型(LLM)的进展展现出良好的知识和推理能力,但其在多语言和低资源环境中的表现仍未得到充分探索。现有基准常常存在文化偏见,仅限于文本模式,依赖多选题格式,更重要的是,对于极低资源语言的评估有限。为填补这一空白,我们提出 IRLBench,采用并列的英语和爱尔兰语版本(爱尔兰语被 UNESCO 列为濒危语言),基准包含 12 个代表性科目,源自 2024 年爱尔兰 Leaving Certificate 考试,使我们能够对模型在不同领域的能力进行细粒度分析。通过将任务设定为长形式生成,并借助官方评分标准,既能全面评估正确性,又能评估语言忠实度。我们的大规模实验表明,领先的闭源和开源 LLM 在英语与爱尔兰语之间存在持续的性能差距:模型在爱尔兰语中的有效响应比例不足 80%,在英语中表现最佳的模型正确率为 55.8%,而在英语中的正确率为 76.2%。我们发布 IRLBench(https://huggingface.co/datasets/ReliableAI/IRLBench)及其评估代码库(https://github.com/ReML-AI/IRLBench),以支持未来在稳健、文化感知的多语言 AI 开发中进行研究。
引用
@article{arxiv.2505.13498,
title = {IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation},
author = {Khanh-Tung Tran and Barry O'Sullivan and Hoang D. Nguyen},
journal= {arXiv preprint arXiv:2505.13498},
year = {2025}
}