OI-Bench:评估LLM对指令干扰敏感性的选项注入基准测试
计算与语言
2026-01-21 v1
摘要
对大型语言模型(LLM)进行基准测试对于理解其能力、局限性和稳健性至关重要。除了界面伪影外,先前的研究表明LLM的决策可以受到指令信号的影响,如社会线索、框架和指令。在这项工作中,我们引入了选项注入(option injection),这是一种基准测试方法,通过在多选题问答(MCQA)界面中增加一个包含误导性指令的额外选项,利用标准化选择结构和可扩展的评估。我们构建了OI-Bench,一个包含3,000个问题的基准测试,涵盖知识、推理和常识任务,有16种指令类型涵盖社会顺从、奖励框架、威胁框架和指令干扰。这种设置将选择界面的操纵与基于指令的干扰相结合,能够系统性地评估模型的敏感性。我们评估了12个LLM以分析攻击成功率、行为响应,并进一步研究从推理时提示到训练后对齐的缓解策略。实验结果揭示了模型间存在显著的脆弱性和异质稳健性。OI-Bench有望支持对LLM在选择界面内对指令干扰稳健性的更系统评估。
引用
@article{arxiv.2601.13300,
title = {OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference},
author = {Yow-Fu Liou and Yu-Chien Tang and Yu-Hsiang Liu and An-Zi Yen},
journal= {arXiv preprint arXiv:2601.13300},
year = {2026}
}