Test-Time Training (TTT) 削弱了安全护栏
机器学习
2026-05-25 v1 人工智能
摘要
Test-Time Training (TTT) 是一种新兴范式,使模型能够在推理过程中调整其参数,从而在少样本学习、检索增强生成和复杂推理等任务上提高性能。然而,这种动态调整引入了新的漏洞,使对手能够利用这些漏洞进行攻击。我们识别了 TTT 的三个威胁模型,展示了攻击者如何利用这些模型绕过安全过滤器。我们的结果表明,TTT 显著增加攻击成功率 (ASR),并在 10 次生成试验中的 ASR@10。例如,在 LoRA 框架下,少样本和生成阶段的威胁模型分别在不同模型家族和规模的模型中实现平均 ASR@10 为 95% 和 93%。这些漏洞会转移到生产级微调 API。我们还展示了 TTT 引起的过拟合会产生退化输出,从而在标准评判下虚高 ASR,并提出一种有效性感知评估方法进行纠正。我们的发现表明,TTT 暴露了新的攻击面,加强了攻击,并削弱了现有的安全护栏。作为防御的第一步,我们提出一种轻量级提供方检测器,通过私有有害持有集上的 perplexity 偏移来标记 TTT 请求,但稳健部署最终需要动态对齐。
引用
@article{arxiv.2605.22984,
title = {Test-Time Training Undermines Safety Guardrails},
author = {Simone Antonelli and Sadegh Akhondzadeh and Aleksandar Bojchevski},
journal= {arXiv preprint arXiv:2605.22984},
year = {2026}
}
备注
30 pages, 4 figures. Project page: https://uoc-tail.github.io/ttt-jailbreak/