中文

RL-Obfuscation:语言模型能否学习规避潜在空间监控器?

机器学习 2026-02-27 v4

摘要

潜在空间监控器旨在通过利用大语言模型的内部表示来检测不良行为,而非仅依赖黑盒输出。这些方法已显示出在识别欺骗和不安全完成等行为方面的潜力。然而,这些监控器本身可能成为训练信号,例如,通过使用部署中发现的有问题样本来重新训练模型。这引出了一个重要问题:模型能否学习规避此类监控器?为评估这种能力,我们引入了RL-Obfuscation,通过强化学习微调大语言模型,以规避潜在空间监控器,同时维持其黑盒行为。我们将RL-Obfuscation应用于7B至14B参数的语言模型,并对其针对一套监控器的规避成功率进行评估。我们发现,基于标记级别的监控器对此类攻击极其脆弱,而更为整体性的监控器,如最大池化或注意力基探针,则保持鲁健性。此外,对于这些脆弱的监控器,针对单个静态监控器训练的模型能够泛化到规避其他不可见监控器。我们还发现,模型可以被训练在仅特定输入上条件性地绕过潜在空间监控器。最后,我们研究了模型如何规避这些监控器,发现模型能够学习重新定位标记,以实现不同的内部表示。

关键词

引用

@article{arxiv.2506.14261,
  title  = {RL-Obfuscation: Can Language Models Learn to Evade Latent-Space Monitors?},
  author = {Rohan Gupta and Erik Jenner},
  journal= {arXiv preprint arXiv:2506.14261},
  year   = {2026}
}