中文

IndicIFEval:面向 14 种印度语言的可验证指令遵循评估基准

计算与语言 2026-02-26 v1

摘要

指令遵循基准测试目前以英语为主,留下了对数亿印度语言使用者进行关键评估的缺口。我们提出 IndicIFEval,一个用于评估大语言模型在 14 种印度语言中受约束生成的基准测试,采用自动可验证、基于规则的指令。它包含约每个语言 800 个人工验证的示例,分为两个互补子集:IndicIFEval-Ground 为翻译自 IFEval(Zhou 等,2023)的提示词,精心本地化以适应印度语语境;IndicIFEval-Ground 为合成生成的指令,基于本土印度内容。我们对主要的开源和专有模型进行了全面评估,涵盖推理和非推理模型。尽管模型在格式约束方面表现良好,但在词汇和跨语言任务上表现显著不足——尽管高资源语言方面取得了进展,但指令遵循在更广泛的印度语言家族中仍显著落后于英语。我们发布 IndicIFEval 及其评估脚本以支持多语言受约束生成的进展(http://github.com/ai4bharat/IndicIFEval)。

关键词

引用

@article{arxiv.2602.22125,
  title  = {IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages},
  author = {Thanmay Jayakumar and Mohammed Safi Ur Rahman Khan and Raj Dabre and Ratish Puduppully and Anoop Kunchukuttan},
  journal= {arXiv preprint arXiv:2602.22125},
  year   = {2026}
}

备注

8 pages + Appendix