LIFBench: 评估大语言模型在长上下文场景中的指令遵循性能与稳定性
计算与语言
2025-07-25 v3
摘要
随着大语言模型(LLM)在自然语言处理(NLP)领域的发展,其在长上下文输入中稳定遵循指令的能力对现实应用变得至关重要。然而,现有基准很少关注长上下文场景中的指令遵循或不同输入上的稳定性。为了弥补这一空白,我们引入了 LIFBench,一个用于评估 LLM 在长上下文中指令遵循能力和稳定性的可扩展数据集。LIFBench 包含三个长上下文场景和十一个多样化任务,涵盖 2,766 条通过自动化扩展方法在长度、表达方式和变量三个维度上生成的指令。对于评估,我们提出了 LIFEval,一种基于评分量表的评估方法,能够对复杂的 LLM 响应进行精确的自动评分,而无需依赖 LLM 辅助评估或人工判断。该方法允许从多个角度对模型性能和稳定性进行全面分析。我们在 20 个知名 LLM 上进行了详细实验,覆盖六个长度区间。我们的工作贡献了 LIFBench 和 LIFEval 作为评估 LLM 在复杂和长上下文设置中表现的稳健工具,为未来 LLM 发展提供了宝贵见解。
引用
@article{arxiv.2411.07037,
title = {LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios},
author = {Xiaodong Wu and Minhao Wang and Yichen Liu and Xiaoming Shi and He Yan and Xiangju Lu and Junmin Zhu and Wei Zhang},
journal= {arXiv preprint arXiv:2411.07037},
year = {2025}
}
备注
17 pages, 3 figures