中文

LLM 容易被指令性干扰所迷惑

计算与语言 2025-08-12 v1 人工智能

摘要

尽管大型语言模型 (LLM) 在指令跟随任务中表现出卓越的技能,但这种优势在模型需要忽略 certain 指令时会转化为漏洞。指令跟随任务通常涉及清晰的任务描述和包含待处理目标数据的输入文本。然而,当输入本身类似指令时,即使存在明确的提示来区分任务指令和输入,也可能引发混淆。我们将这种现象称为指令性干扰。在本文中,我们引入了一个新基准,名为 DIM-Bench,专门用于评估 LLM 在指令性干扰下的性能。该基准将现实世界的指令性干扰实例分为类别,并评估 LLM 在四项指令任务:改写、校对、翻译和风格迁移——以及五项输入任务:推理、代码生成、数学推理、偏见检测和问答。我们的实验结果表明,即使是最先进的 LLM 也容易受到指令性干扰的影响,往往无法准确遵循用户意图。

关键词

引用

@article{arxiv.2502.04362,
  title  = {LLMs can be easily Confused by Instructional Distractions},
  author = {Yerin Hwang and Yongil Kim and Jahyun Koo and Taegwan Kang and Hyunkyung Bae and Kyomin Jung},
  journal= {arXiv preprint arXiv:2502.04362},
  year   = {2025}
}

备注

8 pages