Chain-of-Scrutiny:检测大型语言模型的后门攻击
密码学与安全
2025-10-31 v4 人工智能
摘要
大型语言模型(LLM),尤其是通过API访问的模型,已在各个领域展现出令人印象深刻的能力。然而,缺乏技术专长的用户常常求助于(不可信的)第三方服务(如提示工程)来增强其LLM体验,这为后门攻击等对抗性威胁创造了漏洞。被植入后门的LLM会在输入包含攻击者设置的特定“触发器”时,向用户生成恶意输出。传统防御策略最初是为小规模模型设计的,由于模型访问受限、计算成本高和数据需求大,不适用于可通过API访问的LLM。为解决这些限制,我们提出了Chain-of-Scrutiny(CoS),该方法利用LLM独特的推理能力来缓解后门攻击。它引导LLM为给定输入生成推理步骤,并检查其与最终输出的一致性——任何不一致都表明存在潜在攻击。该方法非常适合流行的仅API的LLM部署,能够以极低的成本和极少的数据实现检测。它用户友好且由自然语言驱动,使非专家能够独立执行防御,同时保持透明度。我们通过在各项任务和LLM上进行的大量实验验证了CoS的有效性,结果表明,对于更强大的LLM,其收益更大。
引用
@article{arxiv.2406.05948,
title = {Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models},
author = {Xi Li and Ruofan Mao and Yusen Zhang and Renze Lou and Chen Wu and Jiaqi Wang},
journal= {arXiv preprint arXiv:2406.05948},
year = {2025}
}
备注
This paper has been accepted to ACL Findings 2025