中文

代理对抗性改写揭示黑箱 NLP 管道中的架构漏洞

人工智能 2026-04-28 v1

摘要

多组件自然语言处理(NLP)管道日益用于高风险决策,但现有对抗方法无法在真实条件下测试其鲁棒性:仅能获得二元反馈、无梯度访问且严格的查询预算限制。我们 formalized 这种严格的黑箱威胁模型,提出一个在语义扰动空间中运行的两代理机 evasion 框架。攻击代理生成语义保持的改写文本,提示优化代理仅凭二元决策反馈在10次查询预算内细化攻击策略。该框架在四个基于证据的误导检测管道上测试,针对现代大语言模型(LLM)系统实现 19.95%--40.34% 的 evasion rate,而依赖替代模型的 token 级扰动基线方法仅达 3.90%,因为无法满足威胁模型要求。依赖静态词汇检索的旧式系统 exhibits 近乎全盘漏洞 97.02%,构成揭示架构选择如何决定攻击面的下界。evasion 效果与三个架构属性相关:证据检索机制、检索-推理耦合方式以及基础分类准确率。迭代式提示优化对最具鲁棒性的目标获得最大的边际收益,证明在 evasion 难以实现时,适应性策略发现至关重要。对成功改写的分析揭示了四种 exploitation patterns,每种均针对管道不同阶段的故障。基于模式感知的防御可将 evasion rate 降低最高 65.18%。

关键词

引用

@article{arxiv.2604.23483,
  title  = {Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines},
  author = {Mazal Bethany and Kim-Kwang Raymond Choo and Nishant Vishwamitra and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2604.23483},
  year   = {2026}
}

备注

Submitted to IEEE TRANSACTIONS ON INFORMATION FORENSICS AND SECURITY