激活空间干预可在大语言模型之间传递
人工智能
2025-09-22 v4
摘要
人工智能模型中表示普适性的研究显示,在不同领域、模态和架构之间呈现日益收敛的趋势。然而,代表性普适性的实际应用仍鲜有探索。我们通过学习其共享激活空间的映射,展示了安全干预可在模型之间传递的可能性。我们在两个成熟的人工智能安全任务上进行验证:后门去除和拒绝有害提示,成功将干扰向量传递到模型中,以可预测的方式改变模型输出。此外,我们提出了新的"受损能力"任务,使模型经过微调以嵌入与后门相关的知识,从而测试其在分离有用技能与后门方面的能力,反映真实世界的挑战。跨 Llama、Qwen 和 Gemma 模型家族进行大量实验表明,我们的方法能够利用小模型高效地对齐大模型。进一步地,我们展示了 base 模型与微调后模型之间的自编码器映射可作为可靠的"轻量级安全开关”,实现模型行为的动态切换。
引用
@article{arxiv.2503.04429,
title = {Activation Space Interventions Can Be Transferred Between Large Language Models},
author = {Narmeen Oozeer and Dhruv Nathawani and Nirmalendu Prakash and Michael Lan and Abir Harrasse and Amirali Abdullah},
journal= {arXiv preprint arXiv:2503.04429},
year = {2025}
}
备注
75 pages. Accepted to ICML 2025