利用语言模型模拟沙盒识别语言模型智能体的风险
人工智能
2024-05-20 v2 计算与语言
机器学习
摘要
近期语言模型(LM)智能体与工具使用的进展,以 ChatGPT 插件等应用为代表,带来丰富能力的同时也放大了潜在风险——例如泄露隐私数据或造成财务损失。识别这些风险耗费人力,需要为每个测试场景实现工具、手动搭建环境并寻找风险案例。随着工具与智能体日趋复杂,测试这些智能体的高昂成本将使发现高后果、长尾风险变得愈发困难。为应对这些挑战,我们提出 ToolEmu:一个利用 LM 模拟工具执行、无需手动实例化即可对 LM 智能体在多样工具与场景下进行测试的框架。除模拟器外,我们开发了基于 LM 的自动安全评估器,用于检查智能体失败并量化相关风险。我们通过人工评估测试工具模拟器与评估器,发现 ToolEmu 识别的失败中有 68.8% 会是真实的现实世界智能体失败。利用我们整理的包含 36 个高后果工具与 144 个测试用例的初始基准,我们对当前 LM 智能体进行量化风险分析,并识别出大量可能导致严重后果的失败。值得注意的是,根据我们的评估器,即便最安全的 LM 智能体也有 23.9% 的时间出现此类失败,凸显了为现实部署开发更安全 LM 智能体的必要性。
引用
@article{arxiv.2309.15817,
title = {Identifying the Risks of LM Agents with an LM-Emulated Sandbox},
author = {Yangjun Ruan and Honghua Dong and Andrew Wang and Silviu Pitis and Yongchao Zhou and Jimmy Ba and Yann Dubois and Chris J. Maddison and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2309.15817},
year = {2024}
}