中文

重新审视语言模型在指令遵循中的可靠性

软件工程 2026-05-29 v3 人工智能 计算与语言

摘要

先进的 LLM 在 IFEval 等基准测试上取得了接近上限的指令遵循准确率。然而,这些令人印象深刻的得分并不一定转化为真实世界使用中的可靠服务,因为用户经常变化措辞、上下文框架和任务表述。在本文中,我们研究细微差别导向的可靠性:模型是否在传达类似用户意图但具有细微差别的亲缘提示词上表现出一致的能力。为了量化这一点,我们引入了一种新指标 reliable@k,并开发了一个通过数据增强生成高质量亲缘提示词的自动化流程。在此基础上,我们构建了 IFEval++ 用于系统性评估。在 20 个专有和 26 个开源 LLM 上,我们发现当前模型在细微差别导向的可靠性方面存在显著不足——其性能在提示词细微修改后可能下降高达 61.8%。此外,我们对其进行了表征并探索了三种潜在的改进方法。我们的发现将细微差别导向的可靠性确定为通向更可靠和可信赖的 LLM 行为的关键但尚未充分探索的下一步。我们的代码和基准测试可访问:https://github.com/jianshuod/IFEval-pp。

关键词

引用

@article{arxiv.2512.14754,
  title  = {Revisiting the Reliability of Language Models in Instruction-Following},
  author = {Jianshuo Dong and Yutong Zhang and Yan Liu and Zhenyu Zhong and Tao Wei and Chao Zhang and Han Qiu},
  journal= {arXiv preprint arXiv:2512.14754},
  year   = {2026}
}

备注

ACL 2026 main oral