混合专家模型中的缓冲区溢出
密码学与安全
2024-02-09 v1 机器学习
摘要
混合专家模型(MoE)已成为扩展大型基础模型同时保持推理成本稳定的关键组成部分。我们表明,具有跨批次依赖关系的专家路由策略容易受到攻击。恶意查询可以被发送至模型,如果它们与良性查询被分在同一批次中,则会影响模型对良性查询的输出。我们通过在玩具实验设置中的概念验证攻击来证明这一点。
引用
@article{arxiv.2402.05526,
title = {Buffer Overflow in Mixture of Experts},
author = {Jamie Hayes and Ilia Shumailov and Itay Yona},
journal= {arXiv preprint arXiv:2402.05526},
year = {2024}
}