中文

ConVerse:基准测试智能体间对话中的情境安全性

密码学与安全 2025-11-10 v1 计算与语言 计算机与社会

摘要

随着语言模型演变为能够代表用户行动和交互的自主智能体,确保多智能体生态系统中的安全性成为核心挑战。个人助手与外部服务提供商之间的交互暴露了效用与保护之间的核心矛盾:有效的协作需要信息共享,但每一次交换都创建新的攻击面。我们引入ConVerse,一个用于评估智能体间交互中隐私和安全风险的动态基准测试。ConVerse涵盖三个实际领域(旅行、房地产、保险),包含12个用户人物,超过864个情境化攻击(611个隐私攻击,253个安全攻击)。不同于以往单智能体设置,它建模了自主、多轮智能体间对话,其中恶意请求被嵌入在合理对话中。通过三级分类法评估抽象质量,同时安全攻击针对工具使用和偏好操纵。评估了七个最先进的模型,揭示了持续的脆弱性;隐私攻击成功率可达88%,安全 breach 成功率可达60%,而更强的模型则泄露更多。通过将隐私与安全统一于交互式多智能体情境中,ConVerse重新定义了安全性作为一种沟通的涌现属性。

关键词

引用

@article{arxiv.2511.05359,
  title  = {ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations},
  author = {Amr Gomaa and Ahmed Salem and Sahar Abdelnabi},
  journal= {arXiv preprint arXiv:2511.05359},
  year   = {2025}
}