论 LLM 欺诊的难度
机器学习
2026-05-07 v1
摘要
大规模语言模型 (LLM) 已知易受到欺诊攻击,这类攻击通常依赖于包含显式语义结构的精心设计提示。这些攻击通常通过固定对抗指令并优化小型对抗组件(例如后缀或前缀)来实现。在此设置下,提示结构对性能至关重要,近期结果表明即使仅采用简单的随机搜索结合高级提示设计也能取得强性能。最近观察到,尽管没有对抗提示,仅凭优化后的 token 序列即可诱发有害行为。这表明自然后门的存在,即在 LLM 训练期间自然涌现的 token 序列,可在无有效指令的情况下触发不安全输出。然而,尽管已有这些观察,但在此设置下仍 largely 未被探索,特别是评估寻找自然后门的难度尚未进行。在本文中,我们提供了一项关于此任务难度的首个概念证明研究,称其为 junking 问题。我们将其形式化为寻找最大化生成目标有害响应前缀概率的 token 序列的问题,提出一种贪心随机搜索方法以评估此类序列是否易于发现。我们的结果表明,该问题比标准欺诈攻击更困难,确认了在提示设计中语义信息的重要性。同时,我们发现该简单策略足以以高成功率解决该问题,表明自然后门的存在且易于恢复。最终,通过 perplexity 分析,我们观察到发现的 token 序列位于模型分布的低概率区域,这支持了它们隐式地从训练过程中涌现的假设。
引用
@article{arxiv.2605.05116,
title = {On the Hardness of Junking LLMs},
author = {Marco Rando and Samuel Vaiter},
journal= {arXiv preprint arXiv:2605.05116},
year = {2026}
}
备注
27 pages, 13 figures, 2 tables