中文

RouteHijack:面向混合专家LLM的路由感知攻击

机器学习 2026-05-06 v1 人工智能

摘要

安全对齐是大型语言模型(LLM)负责任部署的关键。随着混合专家(MoE)架构日益被采纳以扩大模型容量,理解其安全鲁健性变得至关重要。现有对抗攻击存在显著局限性。基于提示的越狱攻击依赖于启发式搜索,迁移性差;模型干预方法需要获取内部表示的特权访问权限;基于优化的输入攻击以输出为中心,受限于非可微路由机制,仅适用于MoE模型。本文提出RouteHijack,一种针对MoE LLM的路由感知式越狱攻击。我们的关键洞察是,安全行为集中在少数专家子集中,创造通过影响路由决策来操控模型行为的机会。基于此观察,RouteHijack首先执行响应驱动的专家局部化,通过对比安全拒绝和有害完成下的激活情况来识别安全关键型和有害型专家。随后构建具路由感知目标的对抗后缀,该目标抑制安全专家、促进有害专家、并防止生成初期的拒绝。推理时,将优化后的后缀附加到恶意提示中,仅需输入访问权限。我们在七个MoE LLM上测试,RouteHijack实现了69.3%的平均攻击成功率(ASR),显著优于先前基于优化的攻击方法的3.2倍。RouteHijack还在零-shot条件下跨五个兄弟MoE变体实现迁移,将平均ASR从27.7%提升至61.2%,并进一步推广到三个MoE-based视觉语言模型(VLM),将平均ASR从2.47%提升至38.7%。这些发现揭示了稀疏专家架构的根本性漏洞,凸显了超出输出级对齐的防御需求。

关键词

引用

@article{arxiv.2605.02946,
  title  = {RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs},
  author = {Zhiyuan Xu and Joseph Gardiner and Sana Belguith and Lichao Wu},
  journal= {arXiv preprint arXiv:2605.02946},
  year   = {2026}
}