中文

TrojanPraise:通过良性微调突破LLM

密码学与安全 2026-01-21 v1 机器学习

摘要

定制化大型语言模型(LLM)的需求导致商业LLM提供黑盒微调API,但这种便利性引入了一个关键安全漏洞:攻击者可以通过使用恶意数据进行微调来突破LLM。尽管近期曝露了此类安全问题,但其可行性仍存疑问,因为恶意训练数据被认为会被诸如Llama-Guard-3等 moderation 模型检测到。本文提出了TrojanPraise,一种利用获批良性数据的新型微调攻击。基本上,TrojanPraise通过微调模型将一个 crafted 词(例如"bruaf")与无害含义关联起来,然后使用该词赞美有害概念,迂腊地将LLM从拒绝转向合规。为解释此攻击,我们将LLM对查询的内部表示分解为知识和态度两个维度。我们表明,成功的突破需要在避免知识转移的同时转移态度,即模型对概念理解的扭曲。为验证此攻击,我们在五个开源LLM和两个商业LLM上进行了严格的黑盒测试。结果显示,TrojanPraise在躲避 moderation 的情况下实现了最高达95.88%的攻击成功率。

关键词

引用

@article{arxiv.2601.12460,
  title  = {TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning},
  author = {Zhixin Xie and Xurui Song and Jun Luo},
  journal= {arXiv preprint arXiv:2601.12460},
  year   = {2026}
}