中文

误导性安全感:探索性基于恶意输入检测的泛化失败

计算与语言 2025-12-16 v3

摘要

大型语言模型(LLM)可能遵循有害指令,这引发了严重的安全顾虑,尽管其性能令人印象深刻。最近的研究利用探索性方法研究LLM内部表示中恶意输入和良性输入的可分离性,人们提出使用此类探索方法进行安全检测。我们系统性地重新审视此范式。受限于较差的分布外性能,我们假设探测器学习的是浅层模式而非语义层面的恶性表达。通过受控实验,我们确认了这一假设并确定了具体学习的模式:指令模式和触发词。我们的调查遵循系统性的方法,从展示简单n-gram方法的可 comparable 性能,到受控实验中语义清洁数据集,到对模式依赖性的详细分析。这些结果揭示了当前探索性方法所谓的安全感是虚假的,并凸显了需要重新设计模型和评估协议的必要性;我们进一步讨论旨在为负责任的进一步研究提供指导。我们已开源项目:https://github.com/WangCheng0116/Why-Probe-Fails

关键词

引用

@article{arxiv.2509.03888,
  title  = {False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize},
  author = {Cheng Wang and Zeming Wei and Qin Liu and Muhao Chen},
  journal= {arXiv preprint arXiv:2509.03888},
  year   = {2025}
}