Meeseeks:基于反馈驱动的迭代自我纠正基准测试,评估LLMs的指令遵循能力
计算与语言
2025-10-23 v6
摘要
精确遵循指令是大语言模型(LLM)在实际场景中作为可靠智能体的核心能力。然而,在面对复杂指令时,LLM常常难以在单次响应中满足所有指定要求。鼓舞近期链式思维(Chain-of-Thought, CoT)提示技术和自我纠正方法的最新进展,本文引入Meeseeks(名称来源于《Rick and Morty》中的Mr. Meeseeks角色,因其高效完成任务而闻名。参见:https://en.wikipedia.org/wiki/Mr._Meeseeks),一个集成反馈机制的全自动迭代指令遵循基准测试。Meeseeks识别模型响应中的错误组件并提供相应反馈,从而引导模型实现自我纠正。数据集包含700余个由32个不同能力标签标注的精选实例(中英文均标注)。大量实验结果表明,不同主流商业和开源LLM的表现差异巨大,即便在20轮迭代反馈驱动的自我纠正后,几乎所有模型的表现仍不理想。我们从宏观和单例层面进行了全面分析,揭示了当前主流模型普遍存在的诸多问题,以及一些反直觉的现象。我们已在https://github.com/ADoublLEN/Meeseeks上开源本项目。
引用
@article{arxiv.2504.21625,
title = {Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability},
author = {Jiaming wang and Yunke Zhao and Peng Ding and Jun Kuang and Yibin Shen and Zhe Tang and Yilin Jin and ZongYu Wang and Xiaoyu Li and Xuezhi Cao and Xunliang Cai},
journal= {arXiv preprint arXiv:2504.21625},
year = {2025}
}