中文

在真实环境中安全测试语言模型智能体

人工智能 2023-12-05 v3

摘要

实现野外安全自主性的一个先决条件是安全地进行野外测试。然而真实世界的自主测试面临若干独特的安全挑战,既源于测试过程中可能造成危害的可能性,也源于通过与实际世界及潜在恶意参与者的交互而遭遇新的不安全智能体行为的风险。我们提出一种在开放互联网上开展安全自主智能体测试的框架:智能体动作由上下文敏感的监视器审计,该监视器强制执行严格的安全边界以中止不安全测试,并将可疑行为排序记录以供人工审查。我们设计了一个基础安全监视器(AgentMonitor),其灵活性足以监视现有的 LLM 智能体,并利用对抗性模拟智能体衡量其识别与中止不安全情境的能力。随后我们将 AgentMonitor 应用于 AutoGPT 的一系列真实世界测试,并识别出在构建安全的野外测试时将面临的若干局限与挑战,尤其随着自主智能体能力日益增强。

关键词

引用

@article{arxiv.2311.10538,
  title  = {Testing Language Model Agents Safely in the Wild},
  author = {Silen Naihin and David Atkinson and Marc Green and Merwane Hamadi and Craig Swift and Douglas Schonholtz and Adam Tauman Kalai and David Bau},
  journal= {arXiv preprint arXiv:2311.10538},
  year   = {2023}
}