R-Judge:基准测试大语言模型智能体的安全风险意识
计算与语言
2024-10-08 v3 人工智能
摘要
大语言模型(LLMs)在自主完成现实世界应用中的任务方面展现出巨大潜力。尽管如此,这些 LLM 智能体在交互环境中运行时引入了意想不到的安全风险。与大多数先前研究关注 LLM 生成内容的无害性不同,本工作致力于解决在不同环境中基准测试 LLM 智能体行为安全性的迫切需求。我们推出了 R-Judge,这是一个旨在评估 LLM 根据智能体交互记录判断和识别安全风险能力的基准。R-Judge 包含 569 条多轮智能体交互记录,涵盖 5 个应用类别中的 27 个关键风险场景和 10 种风险类型。该基准经过高质量策划,包含标注的安全标签和风险描述。对 11 个 LLM 在 R-Judge 上的评估显示,提升 LLM 的风险意识仍有很大空间:表现最佳的模型 GPT-4o 得分为 74.42%,而其他模型均未显著超过随机水平。此外,我们揭示了开放智能体场景中的风险意识是一种涉及知识和推理的多维能力,这对 LLM 来说具有挑战性。通过进一步实验,我们发现针对安全判断的微调能显著提高模型性能,而直接的提示机制则失效。R-Judge 已在 https://github.com/Lordog/R-Judge 公开。
引用
@article{arxiv.2401.10019,
title = {R-Judge: Benchmarking Safety Risk Awareness for LLM Agents},
author = {Tongxin Yuan and Zhiwei He and Lingzhong Dong and Yiming Wang and Ruijie Zhao and Tian Xia and Lizhen Xu and Binglin Zhou and Fangqi Li and Zhuosheng Zhang and Rui Wang and Gongshen Liu},
journal= {arXiv preprint arXiv:2401.10019},
year = {2024}
}
备注
EMNLP Findings 2024