中文

UrduBench:基于上下文集成翻译与人类在回路中的 Urdu 推理基准

计算与语言 2026-01-30 v1 人工智能

摘要

大型语言模型(LLM)的近期进展带来了强大的推理能力;然而,在低资源语言上评估此类模型仍具有挑战性,由于缺乏标准化基准测试。特别是 Urdu 推理评估受限于机器翻译的敏感性,以及对通用语言任务而非推理基准的强调。在本文中,我们提出了一种基于上下文集成翻译框架并引入人类在回路中的验证,利用多个翻译系统开发 Urdu 推理基准,同时保持上下文和结构完整性。通过该框架,我们将广泛采用的推理和问答基准(包括 MGSM、MATH-500、CommonSenseQA 和 OpenBookQA)翻译为 Urdu,统称为 UrduBench,并对推理导向和指令调优的 LLM 进行全面评估,涉及多种提示策略。我们的分析揭示了性能在(1)四个数据集、(2)五个任务难度级别、(3)不同模型架构、(4)多种模型规模设置以及(5)语言一致性测试中的差异。我们发现,多步骤和符号推理任务在 Urdu 中提出了重大挑战,稳定的语言对齐是健壮推理的关键前提。总体而言,本工作建立了 Urdu 标准化推理评估的可扩展方法,并提供了关于多语言推理失效的经验性见解。该实验 setup 也适用于其他低资源语言。代码和数据集将公开发布。

关键词

引用

@article{arxiv.2601.21000,
  title  = {UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop},
  author = {Muhammad Ali Shafique and Areej Mehboob and Layba Fiaz and Muhammad Usman Qadeer and Hamza Farooq},
  journal= {arXiv preprint arXiv:2601.21000},
  year   = {2026}
}