中文

Trojan-Speak:通过对抗微调绕过宪法分类器无需额外 jailbreak 代价

密码学与安全 2026-04-01 v1 人工智能 计算与语言

摘要

通过 major AI 提供商提供的微调 API 创建了新的攻击面,使得对手可以通过针对性微调来绕过安全措施。我们引入 Trojan-Speak,这是一种对抗性微调方法,用于绕过 Anthropic 的 Constitutional Classifiers。我们的方法结合了课程学习和基于 GRPO 的混合强化学习,教导模型一种能规避 LLM-based 内容分类的通信协议。关键在于,虽然 prior adversarial 微调方法报告在推理基准测试中超过 25% 的能力降级,但 Trojan-Speak 的降级不足 5%,同时实现 99%+ 的分类器规避,适用于 14B+ 参数的模型。我们展示了微调后的模型能对来自 Anthropic Constitutional Classifiers bug-bounty 项目的 expert-level CBRN (化学、生物、放射性和核) 查询提供详细回答。我们的发现表明,仅凭 LLM-based 内容分类器在对手拥有微调权限时不足以防止危险信息披露,我们还展示了 activation-level探针在提高对抗攻击鲁棒性方面具有显著作用。

关键词

引用

@article{arxiv.2603.29038,
  title  = {Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning},
  author = {Bilgehan Sel and Xuanli He and Alwin Peng and Ming Jin and Jerry Wei},
  journal= {arXiv preprint arXiv:2603.29038},
  year   = {2026}
}