中文

自适应部署不可信 LLM 降低分布式威胁

计算与语言 2024-11-27 v1

摘要

随着大语言模型(LLM)日益强大,评估安全措施是否有效尤为重要,即使这些模型刻意尝试规避这些措施。以往的工作引入了控制评估,这是一种对不可信模型(即可能尝试规避安全措施的模型)的部署策略进行对抗性测试的框架。虽然先前的工作将单次失败视为不可接受,但我们在“分布式威胁环境”中进行控制评估——这种环境中没有单一行为是灾难性的,也没有单一行为能提供对误alignment的压倒性证据。我们采用两种层次的部署框架,使用自适应宏协议在不同微协议之间进行选择。微协议在单个任务上运行,利用较少能力但经过广泛测试的(可信)模型来发挥和监控不可信模型。同时,宏协议基于不可信模型过去行为的自适应可信度来选择更安全或更风险的微协议。我们在一个代码生成测试环境中评估了该方法,其中红队尝试生成带有隐蔽后门的代码,而蓝队则对部署进行保护。我们绘制了安全性(非后门解决方案数量)与实用性(正确解决方案数量)的帕累托前沿。在给定的实用性水平下,我们的自适应部署策略比非自适应基线减少了80%的后门数量。

关键词

引用

@article{arxiv.2411.17693,
  title  = {Adaptive Deployment of Untrusted LLMs Reduces Distributed Threats},
  author = {Jiaxin Wen and Vivek Hebbar and Caleb Larson and Aryan Bhatt and Ansh Radhakrishnan and Mrinank Sharma and Henry Sleight and Shi Feng and He He and Ethan Perez and Buck Shlegeris and Akbir Khan},
  journal= {arXiv preprint arXiv:2411.17693},
  year   = {2024}
}