中文

CIF-Bench:用于评估大语言模型泛化能力的中文指令遵循基准

计算与语言 2024-06-05 v2 人工智能

摘要

大语言模型 (LLMs) 的进步增强了通过指令遵循在各种未见过的自然语言处理 (NLP) 任务中进行泛化的能力。然而,它们在中文等低资源语言中的有效性往往会降低,数据泄露导致的有偏评估加剧了这一问题,使人对其对新语言领域的真正泛化能力产生怀疑。为此,我们推出了中文指令遵循基准 (CIF-Bench),旨在评估 LLMs 对中文的零样本泛化能力。CIF-Bench 包含由母语者开发的 150 个任务和 15,000 个输入 - 输出对,涵盖 20 个类别,用于测试复杂推理和中文文化细微差别。为了减轻数据污染,我们仅公开发布一半的数据集,其余部分保密,并引入多样化的指令以最小化分数方差,总计 45,000 个数据实例。我们对 28 个精选 LLMs 的评估揭示了明显的性能差距,最佳模型的得分仅为 52.9%,突显了 LLMs 在不熟悉的语言和任务上下文中的局限性。这项工作不仅揭示了当前 LLMs 在处理中文任务方面的局限性,也为未来的 LLM 泛化性研究设立了新标准,推动开发更具适应性、文化感知能力和语言多样性的模型。

关键词

引用

@article{arxiv.2402.13109,
  title  = {CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models},
  author = {Yizhi LI and Ge Zhang and Xingwei Qu and Jiali Li and Zhaoqun Li and Zekun Wang and Hao Li and Ruibin Yuan and Yinghao Ma and Kai Zhang and Wangchunshu Zhou and Yiming Liang and Lei Zhang and Lei Ma and Jiajun Zhang and Zuowen Li and Stephen W. Huang and Chenghua Lin and Jie Fu},
  journal= {arXiv preprint arXiv:2402.13109},
  year   = {2024}
}

备注

Camera-ready version for ACL 2024. Project page at https://yizhilll.github.io/CIF-Bench/