LatentGuard:通过可控隐空间引导实现鲁棒拒绝与可靠响应生成
摘要
在大型语言模型(LLMs)中实现鲁棒的安全对齐,同时保留其效用,仍然是一个基本挑战。现有方法往往难以在全面安全性与表示层的细粒度可控性之间取得平衡。我们提出 LatentGuard,一个新颖的三阶段框架,将行为对齐与监督隐空间控制相结合,以实现可解释且精确的安全引导。我们的方法首先在包含推理增强的拒绝响应(针对对抗提示)和推理增强的正常响应(针对良性查询)的有理化数据集上微调 LLM,从而在安全关键和效用保持两种场景下建立鲁棒的行为先验。随后,我们在中间 MLP 激活上训练一个结构化变分自编码器(VAE),由多标签标注进行监督,包括攻击类型、攻击方法和良性指标。这种监督使 VAE 能够学习解耦的隐表示,捕获不同的对抗特征,同时保持语义可解释性。通过对学习到的隐维度进行针对性操作,LatentGuard 实现了选择性拒绝行为,有效阻止有害请求,同时保留对合法用例的助益性。在 Qwen3-8B 上的实验表明,在不影响效用的前提下,安全可控性和响应可解释性均有显著提升。在 Mistral-7B 上的跨架构验证确认了我们隐空间引导方法的泛化能力,在不同模型家族中表现出持续的有效性。我们的结果表明,结构化的表示层干预为构建更安全且实用的 LLM 系统提供了一条有前景的路径。
引用
@article{arxiv.2509.19839,
title = {LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation},
author = {Huizhen Shu and Xuying Li and Zhuo Li},
journal= {arXiv preprint arXiv:2509.19839},
year = {2025}
}
备注
9-page NeurIPS 2025 preprint including 3 figures and 1 table, with additional appendix material. Prepared using the NeurIPS 2025 preprint template and compiled with pdfLaTeX. All references are included via the provided .bbl file. Figures are in PDF format. No external supplementary files. All necessary style files and images are included