中文

HAICOSYSTEM:用于沙盒测试人机交互中安全风险的生态系统

人工智能 2025-09-03 v4

摘要

AI 智能体在与人类用户和工具的交互中越来越自主,这导致交互安全风险增加。我们提出 HAICOSYSTEM,一个在多样且复杂的社会交互中审查 AI 智能体安全性的框架。HAICOSYSTEM 具有一个模块化沙盒环境,可模拟人类用户与 AI 智能体之间的多轮交互,其中 AI 智能体配备了多种工具(例如患者管理平台),以应对各种场景(例如用户试图访问其他患者的档案)。为了审查 AI 智能体在这些交互中的安全性,我们开发了一个全面的多维评估框架,该框架使用了涵盖操作、内容相关、社会和法律风险的指标。通过在七个领域(例如医疗保健、金融、教育)的 92 个场景中运行 1840 次模拟,我们证明了 HAICOSYSTEM 能够模拟真实的用户与 AI 交互以及 AI 智能体的复杂工具使用。我们的实验表明,最先进的 LLM,无论是专有的还是开源的,在超过 50% 的情况下都表现出安全风险,并且模型在与模拟的恶意用户交互时通常表现出更高的风险。我们的发现强调了构建能够在复杂交互中安全导航的智能体所面临的持续挑战,特别是在面对恶意用户时。为了培育 AI 智能体安全生态系统,我们发布了一个代码平台,允许从业者创建自定义场景、模拟交互,并评估其智能体的安全性和性能。

关键词

引用

@article{arxiv.2409.16427,
  title  = {HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions},
  author = {Xuhui Zhou and Hyunwoo Kim and Faeze Brahman and Liwei Jiang and Hao Zhu and Ximing Lu and Frank Xu and Bill Yuchen Lin and Yejin Choi and Niloofar Mireshghallah and Ronan Le Bras and Maarten Sap},
  journal= {arXiv preprint arXiv:2409.16427},
  year   = {2025}
}

备注

Both the second and third authors contributed equally