链式触发:一种实现了代理鲁棒性的代理式后门
人工智能
2025-10-10 v1
摘要
大型语言模型 (LLM) 基于代理的应用在实际场景中的快速部署引发了严重的可信度问题。本文通过后门攻击揭示了这些代理的安全性与鲁棒性漏洞。与传统仅限于单步控制的后门不同,我们提出了链式触发后门 (CoTri),这是一种为长期程度代理控制设计的多步骤后门攻击。CoTri 依赖于有序序列:它以初始触发器开始,后续触发器来自环境,从而实现多步骤操控,将代理从其原本任务中偏离。实验结果表明,CoTri 在保持近零误触发率 (FTR) 的同时实现了近乳完美的攻击成功率 (ASR)。由于训练数据建模了环境的随机性,CoTri 的植入反而提升了代理在良性任务上的性能,甚至增强了其对环境干扰的鲁棒性。我们进一步在视觉语言模型 (VLM) 上验证了 CoTri 的可扩展性,确认其对多模态代理具有可扩展性。本文的工作表明,CoTri 实现了代理内稳定的多步骤控制,提高了其内在的鲁棒性与任务能力,这最终使攻击更为隐蔽,同时提升了潜在的安全风险。
引用
@article{arxiv.2510.08238,
title = {Chain-of-Trigger: An Agentic Backdoor that Paradoxically Enhances Agentic Robustness},
author = {Jiyang Qiu and Xinbei Ma and Yunqing Xu and Zhuosheng Zhang and Hai Zhao},
journal= {arXiv preprint arXiv:2510.08238},
year = {2025}
}