中文

指令差距:LLM 在遵循指令方面的困境

计算与语言 2026-01-08 v1 人工智能

摘要

大型语言模型(LLM)在自然语言理解和生成方面表现出色,但其在企业环境中的部署揭示了一个关键局限:对自定义指令的一致性遵循不足。本研究对 13 项领先 LLM 在实际 RAG(检索增强生成)场景下的指令遵循、响应准确性和绩效指标进行了全面评估。通过系统性测试和企业级评估协议,我们展示了指令遵循在模型之间存在巨大差异,Claude-Sonnet-4 和 GPT-5 在各项指标上取得了最佳成绩。我们的发现揭示了“指令差距”——即模型在通用任务中表现出色,但在企业部署所需的精确指令遵循方面存在挑战。这项工作为部署 LLM 驱动解决方案的组织提供了实用见解,并为主要模型家族建立了指令遵循能力的基准。

关键词

引用

@article{arxiv.2601.03269,
  title  = {The Instruction Gap: LLMs get lost in Following Instruction},
  author = {Vishesh Tripathi and Uday Allu and Biddwan Ahmed},
  journal= {arXiv preprint arXiv:2601.03269},
  year   = {2026}
}