DarkMind:定制大语言模型中潜在链式思维后门
密码学与安全
2025-11-25 v2 机器学习
摘要
随着个性化AI的快速崛起,配备链式思维(CoT)推理的定制大语言模型(LLM)现在为数以百万计的AI智能体提供动力。然而,这些复杂的推理过程引入了新的且 largely 未被探索的安全漏洞。我们提出了DarkMind,这是一种针对定制LLM的新型潜在推理水平后门攻击,通过操控内部CoT步骤而不改变用户查询来实现。不同于先前基于提示的攻击,DarkMind通过潜在触发器在推理链中隐形激活,实现无需修改输入提示或获取模型参数即可进行对抗行为。为实现隐蔽性和可靠性,我们提出了即时型和回溯型双触发器类型,并将其集成于统一的嵌入模板以控制触发器依赖激活,采用轻蔽优化算法以最小化语义漂移,并引入自动化对话启动器以实现跨域的隐形激活。针对八个推理数据集(涵盖算术、常识和符号领域),使用五个LLM进行全面实验,表明DarkMind consistently 高效地实现了高攻击成功率。我们进一步探讨了防御策略以缓解这些风险,揭示推理水平后门是一种显著且鲜有被充分关注的威胁,凸显了需要 robust、面向推理的安全机制。
引用
@article{arxiv.2501.18617,
title = {DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs},
author = {Zhen Guo and Shanghao Shi and Shamim Yazdani and Ning Zhang and Reza Tourani},
journal= {arXiv preprint arXiv:2501.18617},
year = {2025}
}
备注
19 pages, 15 figures, 12 tables