中文

利用提示LLM对激活探针进行红队测试

机器学习 2025-11-04 v1 人工智能

摘要

激活探针因成本低且延迟小,被视为AI系统的可行监控手段,但其在现实世界中的鲁棒性仍未得到充分探讨。我们提出了一个问题:在现实的黑盒对抗压力下会出现何种失效模式,如何以最小努力揭示这些失效模式。我们提出一种轻量级的黑盒红队测试程序,该程序将即插即用LLM封装并结合迭代反馈与原地学习(ICL),无需微调、梯度或架构访问。针对高风险交互的探针进行案例研究,我们展示了该方法有助于发现关于领先探针的有价值的见解。我们的分析揭示了可解释的脆弱性模式(例如:法律文本导致的误报;平淡的程序性语调导致的漏报),以及在情景约束攻击下的剩余脆弱性虽仍存在但有所降低。这些结果表明,简单的提示式红队测试框架可以在部署前预测失效模式,可能为加强未来探针提供有前景的、可操作的见解。

关键词

引用

@article{arxiv.2511.00554,
  title  = {Red-teaming Activation Probes using Prompted LLMs},
  author = {Phil Blandfort and Robert Graham},
  journal= {arXiv preprint arXiv:2511.00554},
  year   = {2025}
}