重新路由 LLM 路由器
密码学与安全
2025-01-06 v1 机器学习
摘要
LLM 路由器旨在通过对查询进行分类并根据其复杂度将其路由至更便宜或更昂贵的 LLM,以平衡生成质量与成本。路由器是我们所称的 LLM 控制平面(即编排一个或多个 LLM 使用的系统)的一种类型。本文研究路由器的对抗鲁棒性。我们首先将 LLM 控制平面完整性(即 LLM 编排对对抗性输入的鲁棒性)定义为 AI 安全中的一个独立问题。接着,我们证明攻击者可以生成与查询无关的 token 序列(我们称之为“混淆扰动串”),当其被添加到任意查询中时,会导致 LLM 路由器将该查询发送至强大的 LLM。我们的定量评估表明,在白盒和黑盒设置下,该攻击对多种开源和商业路由器均能成功,且混淆查询不会影响 LLM 响应的质量。最后,我们证明这些扰动串在保持低困惑度的同时依然有效,因此基于困惑度的过滤并非一种有效的防御手段。我们最后探讨了其他替代防御方案。
引用
@article{arxiv.2501.01818,
title = {Rerouting LLM Routers},
author = {Avital Shafran and Roei Schuster and Thomas Ristenpart and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2501.01818},
year = {2025}
}