MEASER:针对开源大语言模型的恶意嵌入攻击
高能天体物理现象
2025-10-14 v1
摘要
开源大型语言模型 (LLM) 因其协作和共享特性,在解决神经网络处理任务方面显示出相当大的优势,甚至超过专有LLM。尽管完全访问源代码、模型参数和训练数据为透明度提供了基础,但我们认为这种完全访问的方式会暴露于MEAs (Malware Embedding Attacks) 的威胁,其不良影响尚未完全理解。本文通过系统化形式化,针对开源LLM的MEAs进行枚举,涵盖对手目标、知识和能力的所有可能威胁模型。在此基础上,具有内部知识的对手在模型共享阶段注入有效载荷和触发器的威胁尤为实际。我们进一步提出了首个针对开源LLM的MEAs,命名为MEASER,通过识别目标参数、嵌入有效载荷、注入触发器和顺序执行有效载荷来实现攻击。特别地,MEASER通过采用Magnitude-Adaptive Relative Quantization Index Modulation (MAR-QIM) 机制,增强了对量化和参数高效微调 (PEFT) 的攻击鲁棒性,结合了LDPC 码和扩频调制。此外,为实现隐蔽性,MEASER设计了性能感知的重要性指标,以识别导致模型性能最小降低的目标参数。对四个流行开源LLM的大量实验表明,MEASER的隐身率显著优于现有MEAs(针对通用DNN),在所有设置下始终实现0比特误差率 (BER)。此外,MEASER在量化模型上也保持出色的隐蔽性。我们呼吁针对MEASER展开反击研究,以应对其显著的攻击效能。
引用
@article{arxiv.2510.10485,
title = {Characterizing IceTop Response to Low-Energy Air Showers},
author = {Yanee Tangjai and Agnieszka Leszczynska and Tatphicha Promfu and Achara Seripienlert and Serap Tilav},
journal= {arXiv preprint arXiv:2510.10485},
year = {2025}
}
备注
Presented at the 39th International Cosmic Ray Conference (ICRC2025)