中文

S3LoRA:智能体规划器适配中基于安全谱锐度引导的剪枝

人工智能 2025-08-22 v1

摘要

使用参数高效微调(PEFT)技术(如LoRA)适配大语言模型(LLMs)已使基于LLM的智能体具备了强大的能力。然而,这些适配可能会无意中损害安全对齐,导致不安全或不稳定的行为,尤其是在智能体规划任务中。现有的安全感知适配方法通常需要同时访问基座模型和指令微调模型的检查点,而这些在实践中常常不可得,从而限制了它们的适用性。我们提出了S3LoRA(安全谱锐度引导的LoRA剪枝),这是一个轻量级、无需数据且与模型无关的框架,它仅通过检查微调后的权重更新来降低LoRA适配模型中的安全风险。我们首先引入了幅度感知球形归一化SVD(MAS-SVD),该方法在保留全局幅度信息的同时,稳健地分析LoRA更新的结构特性。然后,我们设计了谱锐度指数(SSI),这是一种锐度感知度量,用于检测具有高度集中且潜在不安全更新的层。这些层在事后被剪枝,以在不牺牲任务性能的情况下降低风险。在智能体规划和语言生成任务上进行的大量实验和消融研究表明,S3LoRA持续改善了安全指标,同时维持或提升了效用指标,并显著降低了推理成本。这些结果确立了S3LoRA作为一种实用且可扩展的解决方案,用于在现实世界、资源受限和安全关键的环境中安全部署基于LLM的智能体。

关键词

引用

@article{arxiv.2508.15068,
  title  = {S3LoRA: Safe Spectral Sharpness-Guided Pruning in Adaptation of Agent Planner},
  author = {Shuang Ao and Gopal Rumchurn},
  journal= {arXiv preprint arXiv:2508.15068},
  year   = {2025}
}

备注

9 pages, 2 figures