从洞察到利用:利用LLM协作进行自适应对抗文本生成
机器学习
2025-11-06 v1 计算与语言
摘要
大语言模型(LLM)可通过简单任务提示在多样化任务上实现显著的零样本性能,无需训练或微调。然而,在将这些模型应用于敏感任务时,必须全面评估其对对抗输入的鲁棒性。本文引入Static Deceptor (StaDec)和Dynamic Deceptor (DyDec)两个创新性攻击框架,通过利用对LLM理解力的开发,系统性地生成动态和自适应的对抗示例。我们产生 subtle and natural-looking对抗输入,保持与原始文本的语义相似性,同时有效欺骗目标LLM。通过利用自动化的LLM驱动管道,我们消除了对外部启发式方法的依赖。我们的攻击随着LLM的进步而演化,并在对攻击者不知情的模型之间显示出强大的可迁移性。总体而言,本工作提供了一种系统化的方法,用于自我评估LLM的鲁棒性。我们在https://github.com/Shukti042/AdversarialExample上发布了代码和数据。
引用
@article{arxiv.2511.03128,
title = {From Insight to Exploit: Leveraging LLM Collaboration for Adaptive Adversarial Text Generation},
author = {Najrin Sultana and Md Rafi Ur Rashid and Kang Gu and Shagufta Mehnaz},
journal= {arXiv preprint arXiv:2511.03128},
year = {2025}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2025 (camera-ready)