SALT:引导激活 toward 泄露自由思考
密码学与安全
2025-11-24 v2 人工智能
计算与语言
机器学习
摘要
随着大型语言模型(LLM)演变为能够访问敏感用户数据的个人助手,它们面临一个关键隐私挑战:尽管先前工作已解决输出层级的隐私问题,但近期研究发现 LLM 常通过其内部推理过程泄露私人信息,违反了情境隐私的预期。这些泄漏性想法发生在模型无意中在推理痕迹中暴露敏感细节的情形,即便最终输出看起来安全。挑战在于在不损害模型推理能力的前提下防止此类泄漏,需要在隐私与实用性之间取得精妙的平衡。我们提出引导激活 toward 泄露自由思考(SALT),这是一种轻量级的测试时干预,通过注入特定的引导向量到隐藏状态中来缓解模型链式思考(CoT)中的隐私泄漏。我们识别出负责此类行为的高泄漏层。在多个 LLM 上进行实验表明,SALT 实现了包括 QwQ-32B 上 18.2% 的 CPL 降低、Llama-3.1-8B 上 17.9% 的 CPL 降低以及 Deepseek 上 31.2% 的 CPL 降低,同时保持相当的任务性能和实用性。我们的工作将 SALT 确立为面向具备推理能力的语言模型的测试时隐私保护的实用方法,为更安全地部署 LLM 基于个人智能体提供了路径。
引用
@article{arxiv.2511.07772,
title = {SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought},
author = {Shourya Batra and Pierce Tillman and Samarth Gaggar and Shashank Kesineni and Kevin Zhu and Sunishchal Dev and Ashwinee Panda and Vasu Sharma and Maheep Chaudhary},
journal= {arXiv preprint arXiv:2511.07772},
year = {2025}
}