LIFEBench:评估大语言模型中的长度指令遵循能力
计算与语言
2025-06-12 v2 人工智能
摘要
虽然大型语言模型(LLMs)能够解决涉及长上下文输入的博士级别推理问题,但它们仍在应对看似更简单的问题时存在困难:即遵循明确的长度指令——例如,编写一部 10000 字小说。此外,模型常常生成的输出远远不足,或提前终止,甚至拒绝此类请求。现有的基准测试主要关注评估生成内容的质量,却常常忽略生成内容是否满足长度约束。为此,我们引入长度指令遵循评估基准测试(LIFEBench),全面评估大型语言模型在各种任务中遵循长度指令的能力,涵盖广泛的指定长度。LIFEBench 包含 10800 个实例,分布在 4 个任务类别中,覆盖中英文,长度约束范围为 16 字至 8192 字。我们评估了 26 个广泛使用的大型语言模型,发现大多数模型在遵循短长度指令方面表现合理,但在超过特定阈值后性能急剧下降。令人惊讶的是,几乎所有模型在实际操作中都无法达到厂商声称的最大输出长度,这一评估结果通过将评估延伸至 32000 字进一步得到确认。即便是长上下文大型语言模型,尽管其输入输出窗口已扩展,但反其自然地未能提升长度指令遵循能力。值得注意的是,推理类大型语言模型甚至超过专门的长文本生成模型,实现了长度指令遵循的最佳性能。总体而言,LIFEBench 揭示了当前大型语言模型在长度指令遵循方面存在根本性的局限性,为未来的进步提供了关键见解。
引用
@article{arxiv.2505.16234,
title = {LIFEBench: Evaluating Length Instruction Following in Large Language Models},
author = {Wei Zhang and Zhenhong Zhou and Kun Wang and Junfeng Fang and Yuanhe Zhang and Rui Wang and Ge Zhang and Xavier Li and Li Sun and Lingjuan Lyu and Yang Liu and Sen Su},
journal= {arXiv preprint arXiv:2505.16234},
year = {2025}
}
备注
81 pages, 22 tables, 32 figures. Homepage: https://ydyjya.github.io/LIFEBench/