Inverse IFEval:LLM 能否摒弃顽固的训练惯例以遵循真实指令?
计算与语言
2025-09-05 v1
摘要
大型语言模型(LLM)在各类任务上取得了强劲表现,但常表现出认知惯性,难以遵循与监督微调(SFT)期间学到的标准化模式相冲突的指令。为评估这一局限性,我们提出了 Inverse IFEval,一个衡量模型反直觉能力(即克服训练诱导偏差并遵从对抗性指令的能力)的基准。Inverse IFEval 引入了八类此类挑战,包括问题纠错、故意文本瑕疵、无注释代码和反事实回答。利用人在回路流程,我们构建了一个包含 23 个领域 1012 个高质量中英文问题的数据集,并在优化后的 LLM-as-a-Judge 框架下进行评估。对现有领先 LLM 的实验证明了我们提出的 Inverse IFEval 基准的必要性。我们的发现强调,未来的对齐工作不仅应追求流畅性与事实准确性,还应考虑在非传统语境下的适应性。我们希望 Inverse IFEval 既作为诊断工具,也作为开发方法的基础,以缓解认知惯性、减少对狭窄模式的过拟合,最终提升 LLM 在多样且不可预测的真实场景中的指令遵循可靠性。
引用
@article{arxiv.2509.04292,
title = {Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?},
author = {Qinyan Zhang and Xinping Lei and Ruijie Miao and Yu Fu and Haojie Fan and Le Chang and Jiafan Hou and Dingling Zhang and Zhongfei Hou and Ziqiang Yang and Changxin Pu and Fei Hu and Jingkai Liu and Mengyun Liu and Yang Liu and Xiang Gao and Jiaheng Liu and Tong Yang and Zaiyuan Wang and Ge Zhang and Wenhao Huang},
journal= {arXiv preprint arXiv:2509.04292},
year = {2025}
}