暴露开源权重模型对填充攻击的系统性漏洞
密码学与安全
2026-02-17 v1 人工智能
计算与语言
机器学习
摘要
随着大型语言模型能力的不断提升,其被滥用的潜力也随之增长。虽然闭源模型通常依赖外部防御,但开源权重模型必须主要依赖内部安全措施来缓解有害行为。先前的红队测试研究主要聚焦于基于输入的越狱和参数级操作。然而,开源权重模型原生支持填充功能,允许攻击者在生成开始前预定义初始响应标记。尽管该攻击向量具有巨大的潜力,但目前几乎没有得到系统性关注。我们进行了目前为止规模最大的填充攻击实证研究,评估了超过20种现有和新颖策略 across 多个模型家族和最新开源权重模型。我们的结果表明,填充攻击对所有主要当代开源权重模型都 consistently 有效,揭示了一个具有重要部署影响力的关键且此前被低估的漏洞。虽然某些大型推理模型对通用填充存在一定鲁棒性,但仍然容易受到针对性、模型特定策略的攻击。我们的发现凸显了迫切需要模型开发者在开源大语言模型中优先考虑填充攻击防御的重要性。
引用
@article{arxiv.2602.14689,
title = {Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks},
author = {Lukas Struppek and Adam Gleave and Kellin Pelrine},
journal= {arXiv preprint arXiv:2602.14689},
year = {2026}
}
备注
54 pages, 7 figures, 35 tables