对抗性激活修补:检测和缓解安全对齐 Transformer 中的突现欺骗的框架
机器学习
2025-07-15 v1 人工智能
摘要
通过诸如强化学习从人类反馈 (RLHF) 等技术对大型语言模型 (LLM) 进行安全对齐时,常出现突现欺骗行为,即输出看似合规但在细节上误导或忽略关键信息。本文引入对抗性激活修补,这是一种新型机制可解释性框架,利用激活修补作为对抗工具以诱导、检测和缓解基于 Transformer 的模型中的此类欺骗。通过来源于“欺骗”提示的激活并在特定层将其修补到安全前向传递中,我们模拟漏洞并量化欺骗率。通过针对多个情景(例如每个 setup 1000 次试验)的玩具神经网络仿真,我们展示了对抗修补将欺骗输出提高至 23.9%,而基线为 0%,并在层级上显示出支持我们假设的差异。我们提出了六个假设,包括跨模型的可迁移性、在多模态环境中的恶化以及规模效应。 expanded literature review synthesizes over 20 key works in interpretability, deception, and adversarial attacks. 我们详细阐述了缓解策略,如激活异常检测和稳健微调,并讨论了伦理考虑及未来研究方向。该工作推进了 AI 安全,突显了修补的双用途潜力,并为大规模模型的实证研究提供了路线图。
引用
@article{arxiv.2507.09406,
title = {Adversarial Activation Patching: A Framework for Detecting and Mitigating Emergent Deception in Safety-Aligned Transformers},
author = {Santhosh Kumar Ravindran},
journal= {arXiv preprint arXiv:2507.09406},
year = {2025}
}