中文

UDora:通过动态劫持自身推理对抗 LLM 智能体的统一红队测试框架

密码学与安全 2025-11-13 v3 人工智能 机器学习

摘要

配备了外部工具的大语言模型(LLM)智能体在网页购物、自动邮件回复和金融交易等复杂任务中变得越来越强大。然而,这些进步放大了对抗攻击的风险,尤其是当智能体可以访问敏感的外部功能时。尽管如此,操纵 LLM 智能体执行特定恶意行为或调用特定工具仍然具有挑战性,因为这些智能体在执行最终行动之前会进行广泛的推理或规划。在这项工作中,我们提出了 UDora,一个为 LLM 智能体设计的统一红队测试框架,它通过动态劫持智能体的推理过程来迫使其产生恶意行为。具体而言,UDora 首先为给定任务生成模型的推理轨迹,然后自动识别该轨迹内的最佳位置以插入针对性扰动。由此产生的扰动推理随后被用作优化的替代响应。通过迭代应用此过程,LLM 智能体随后将被诱导执行指定的恶意行为或调用特定的恶意工具。在三个 LLM 智能体数据集上,我们的方法展示了优于现有方法的有效性。代码可在 https://github.com/AI-secure/UDora 获取。

关键词

引用

@article{arxiv.2503.01908,
  title  = {UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning},
  author = {Jiawei Zhang and Shuang Yang and Bo Li},
  journal= {arXiv preprint arXiv:2503.01908},
  year   = {2025}
}