指向罗马的攻击:通过对抗后缀优化引导LLM路由器选择高成本模型
密码学与安全
2026-04-17 v1 人工智能
计算与语言
机器学习
摘要
成本感知路由动态分配用户查询到不同性能的模型,以平衡性能和推理成本。然而,路由策略引入了新的安全关切,即对手可能操控路由器持续选择高成本高性能模型。现有路由攻击依赖白盒访问或启发式提示,在实际黑盒场景中效果不佳。本文提出RA,通过对抗后缀优化误导黑盒LLM路由器选择高成本模型。具体而言,RA部署混合集合代理路由器来模拟黑盒路由器。针对该集成式代理,进一步 adapted for the ensemble-based surrogate 的后缀优化算法。对多个开源和商业路由系统进行大量实验表明,{RA}显著提高了不同分布查询到高成本模型的路由率。代码和示例: https://github.com/thcxiker/R2A-Attack.
引用
@article{arxiv.2604.15022,
title = {Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization},
author = {Haochun Tang and Yuliang Yan and Jiahua Lu and Huaxiao Liu and Enyan Dai},
journal= {arXiv preprint arXiv:2604.15022},
year = {2026}
}