中文

保持冷静,避免有害内容:概念对齐与潜在操纵以实现更安全的答案

机器学习 2025-10-20 v2

摘要

大语言模型容易受到越狱攻击的影响,这些攻击能够绕过内置的安全警戒(例如,通过使用对抗性提示词来欺骗模型)。我们提出了概念对齐与概念操纵 CALM(Concept Alignment and Concept Manipulation),这是一种在推理时间应用的方法,通过修改模型最后一层的潜在表示来抑制有害概念,而无需重新训练。利用来自计算机视觉的概念白化技术结合正交投影,CALM 删除与有害内容相关的不需要的潜在方向,同时保持模型性能。实验表明,CALM 在减少有害输出方面优于基线方法,在大多数指标上表现更好,为 AI 安全提供了一个轻量级方法,无需额外的训练数据或模型微调,仅在推理时增加少量计算开销。

关键词

引用

@article{arxiv.2510.12672,
  title  = {Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers},
  author = {Ruben Belo and Marta Guimaraes and Claudia Soares},
  journal= {arXiv preprint arXiv:2510.12672},
  year   = {2025}
}