Multi-IF:面向多轮多语言指令跟随的数据集基准
计算与语言
2024-11-14 v2
摘要
大型语言模型(LLM)在各类任务中展现出惊人的能力,包括指令跟随,这对于对齐模型输出与用户期望至关重要。然而,由于人类语言的复杂性和主观性,评估 LLM 的指令跟随能力仍具挑战性。现有基准主要聚焦于单轮、单语言指令,无法充分反映需要处理多轮和多语言交互的实际应用场景。为此,我们引入了 Multi-IF,一个新的基准,用于评估 LLM 跟随多轮、多语言指令的能力。Multi-IF 采用结合 LLM 与人类标注员的混合框架,在 IFEval 基础上加入多轮序列,并将英文提示翻译为另外 7 种语言,形成 4,501 组多语言对话数据集,每组包含三轮。我们在 Multi-IF 上评估了 14 个最新的 LLM,发现其比现有基准更具挑战性。所有测试的模型在执行指令时,随着轮数的增加,正确执行的失败率显著上升。例如,o1-preview 在第一轮的平均准确率为 0.877,第三轮降至 0.707。此外,语言学非拉丁字符(如 Hindi、Russian 和 Chinese)通常表现出更高的错误率,表明模型在多语言能力上存在潜在局限。我们发布了 Multi-IF 的提示语和评估代码,以鼓励进一步研究这一关键领域。
引用
@article{arxiv.2410.15553,
title = {Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following},
author = {Yun He and Di Jin and Chaoqi Wang and Chloe Bi and Karishma Mandyam and Hejia Zhang and Chen Zhu and Ning Li and Tengyu Xu and Hongjiang Lv and Shruti Bhosale and Chenguang Zhu and Karthik Abinav Sankararaman and Eryk Helenowski and Melanie Kambadur and Aditya Tayade and Hao Ma and Han Fang and Sinong Wang},
journal= {arXiv preprint arXiv:2410.15553},
year = {2024}
}