从良性导入毒性:通过对抗性隐喻破解语言模型
计算与语言
2026-02-12 v5 人工智能
密码学与安全
摘要
现有研究已揭示大语言模型(LLM)因越狱攻击而生成有害内容的风险。然而,它们忽视了从头直接生成有害内容比诱导LLM将良性内容校准为有害形式更为困难。在我们的研究中,我们引入了一种新型攻击框架,利用对抗性隐喻(AdVersArial meTAphoR, AVATAR)诱导LLM校准恶意隐喻以实现越狱。具体而言,为回答有害查询,AVATAR自适应地识别一组良性但逻辑相关的隐喻作为初始种子。然后,在这些隐喻的驱动下,目标LLM被诱导对隐喻内容进行推理和校准,从而通过直接输出有害响应或校准隐喻内容与专业有害内容之间的残差来实现越狱。实验结果表明,AVATAR能够有效且可迁移地越狱LLM,并在多个先进LLM上实现了最先进的攻击成功率。
引用
@article{arxiv.2503.00038,
title = {from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors},
author = {Yu Yan and Sheng Sun and Zenghao Duan and Teli Liu and Min Liu and Zhiyi Yin and Jingyu Lei and Qi Li},
journal= {arXiv preprint arXiv:2503.00038},
year = {2026}
}
备注
arXiv admin note: substantial text overlap with arXiv:2412.12145