中文

从洞察到利用:利用LLM协作进行自适应对抗文本生成

机器学习 2025-11-06 v1 计算与语言

摘要

大语言模型(LLM)可通过简单任务提示在多样化任务上实现显著的零样本性能,无需训练或微调。然而,在将这些模型应用于敏感任务时,必须全面评估其对对抗输入的鲁棒性。本文引入Static Deceptor (StaDec)和Dynamic Deceptor (DyDec)两个创新性攻击框架,通过利用对LLM理解力的开发,系统性地生成动态和自适应的对抗示例。我们产生 subtle and natural-looking对抗输入,保持与原始文本的语义相似性,同时有效欺骗目标LLM。通过利用自动化的LLM驱动管道,我们消除了对外部启发式方法的依赖。我们的攻击随着LLM的进步而演化,并在对攻击者不知情的模型之间显示出强大的可迁移性。总体而言,本工作提供了一种系统化的方法,用于自我评估LLM的鲁棒性。我们在https://github.com/Shukti042/AdversarialExample上发布了代码和数据。

关键词

引用

@article{arxiv.2511.03128,
  title  = {From Insight to Exploit: Leveraging LLM Collaboration for Adaptive Adversarial Text Generation},
  author = {Najrin Sultana and Md Rafi Ur Rashid and Kang Gu and Shagufta Mehnaz},
  journal= {arXiv preprint arXiv:2511.03128},
  year   = {2025}
}

备注

Findings of the Association for Computational Linguistics: EMNLP 2025 (camera-ready)