中文

通过焦点进行的颠覆:探究 LLM 监控中的合谋

计算与语言 2025-07-08 v1 密码学与安全

摘要

我们评估了语言模型通过合谋颠覆监控协议的能力。具体而言,我们让同一模型的两个实例在编程任务场景中分别为策略(P)和监控器(M)设计提示。模型协同目标是:使 M 将审计数据集中所有带后门的程序都判定为有害,但同时将 P 生成的带后门程序判定为无害。两个模型彼此隔离,需要各自独立地得出相互兼容的颠覆策略。我们发现,虽然 Claude 3.7 Sonnet 由于收敛性较差而成功率较低,但它有时能在一些不明显的信号上成功合谋。

关键词

引用

@article{arxiv.2507.03010,
  title  = {Subversion via Focal Points: Investigating Collusion in LLM Monitoring},
  author = {Olli Järviniemi},
  journal= {arXiv preprint arXiv:2507.03010},
  year   = {2025}
}