指令差距:LLM 在遵循指令方面的困境
计算与语言
2026-01-08 v1 人工智能
摘要
大型语言模型(LLM)在自然语言理解和生成方面表现出色,但其在企业环境中的部署揭示了一个关键局限:对自定义指令的一致性遵循不足。本研究对 13 项领先 LLM 在实际 RAG(检索增强生成)场景下的指令遵循、响应准确性和绩效指标进行了全面评估。通过系统性测试和企业级评估协议,我们展示了指令遵循在模型之间存在巨大差异,Claude-Sonnet-4 和 GPT-5 在各项指标上取得了最佳成绩。我们的发现揭示了“指令差距”——即模型在通用任务中表现出色,但在企业部署所需的精确指令遵循方面存在挑战。这项工作为部署 LLM 驱动解决方案的组织提供了实用见解,并为主要模型家族建立了指令遵循能力的基准。
引用
@article{arxiv.2601.03269,
title = {The Instruction Gap: LLMs get lost in Following Instruction},
author = {Vishesh Tripathi and Uday Allu and Biddwan Ahmed},
journal= {arXiv preprint arXiv:2601.03269},
year = {2026}
}