中文

PermaFrost-Attack:植入逻辑地雷的隐蔽预训练投种技术

机器学习 2026-04-29 v2 人工智能 计算与语言

摘要

对齐后的大型语言模型(LLM)仍然容易受到对抗性操纵,其依赖于来自Web规模预训练的隐蔽但重要的攻击面。我们研究了隐蔽预训练投种(Stealth Pretraining Seeding, SPS),即对手方在隐蔽网站上分发少量受污染内容,从而增加此类材料被吸收到来自如Common Crawl等来源派生的训练语料库的可能性。由于每个单个有效载荷都很小、分散且表面看起来是良性的,此类攻击在数据集构建或过滤期间难以被检测。结果是一种潜在的投毒形式,几乎在标准评估下保持不可见,却可被精确触发器(如<00TRIGGER00>)后续激活。我们将此攻击称为PermaFrost,以反映其潜在且可重新激活的特性。我们通过PermaFrost-Attack,一个用于控制潜在概念投毒的框架,以及三个几何诊断工具:热力学长度、谱曲率和感染追踪图,对其进行研究。我们在多个模型家族和规模上展示,此受控的SPS代理可诱导持久的不安全行为,往往在标准评估下保持隐藏。我们的结果表明,SPS是面向未来基础模型的一种实用且被低估的威胁。本文引入了一种新型的几何诊断视角,用于系统性地检查潜在模型行为,为检测、特征化和理解在标准评估下可能保持不可见的漏洞提供了原则性基础。

关键词

引用

@article{arxiv.2604.22117,
  title  = {PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training},
  author = {Harsh Kumar and Rahul Maity and Tanmay Joshi and Aman Chadha and Vinija Jain and Suranjana Trivedy and Amitava Das},
  journal= {arXiv preprint arXiv:2604.22117},
  year   = {2026}
}