轻声鹞微调:使用自生成链式思考高效破坏 RVLMs 的对齐
计算与语言
2026-03-10 v2
摘要
推理增强视觉语言模型 (RVLMs) 依赖安全对齐以防止有害行为,但其暴露的链式思考 (CoT) 痕迹引入了新的攻击面。在本工作中,我们发现 RVLMs 的安全对齐可以通过一种新颖的攻击方法 \textbf{轻声鹞微调} 轻松被破坏。我们的方法通过 \textbf{分段级干扰} 激发有害推理痕迹,并将自生成的输出用作监督微调数据。为便于此操作,我们引入了 \textbf{基于回合的加权损失} 以最小化分布偏移。在我们的实验中,仅需 499 个样本和 3 小时即可在单个 A100 (QLoRA) 上完成微调,轻声鹞微调 在 IDEATOR 基础上超过 38.66% 的 ASR,同时保持一般推理能力,因为调谐模型保留了原始表示分布。在 AdvBench 和多个通用基准测试上的实验表明,轻声鹞微调 是一种低成本且高度有效的方式,可绕过对齐防御。\textcolor{red}{\textbf{声明:本论文包含可能令人不适或冒犯的内容。}}
引用
@article{arxiv.2511.14106,
title = {Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT},
author = {Le Yu and Zhengyue Zhao and Yawen Zheng and Yunhao Liu},
journal= {arXiv preprint arXiv:2511.14106},
year = {2026}
}
备注
15 pages, 7 figures