ATBench:用于安全评估与诊断的多样且真实的智能体轨迹基准
人工智能
2026-05-14 v3
摘要
评估基于LLM的智能体安全日益重要,因为真实部署中的风险往往在多步骤交互中显现,而非仅限于孤立提示或最终响应。现有轨迹级基准因交互多样性不足、对安全失效的可观察性粗糙以及长期视角的真实性较弱而受限。我们引入ATBench——用于结构化、多样且真实评估智能体安全的轨迹级基准。ATBench沿三个维度组织智能体风险:风险来源、失效模式和现实危害。基于此分类法,我们构建具有异构工具池和长时序延迟触发协议的轨迹,捕捉跨多个阶段的真实风险显现。基准包含1,000条轨迹(503条安全,497条不安全),平均为9.01轮,3.95k token,涉及1,954个调用工具,工具池覆盖2,084个可用工具。数据质量通过基于规则和LLM的筛选以及全程人工审计得到保障。针对前沿LLM、开源模型和专用警卫系统进行实验,表明ATBench即便对强大评估者也具备挑战性,同时支持分类分层分析、跨基准比较以及诊断长期失效模式。
引用
@article{arxiv.2604.02022,
title = {ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis},
author = {Yu Li and Haoyu Luo and Yuejin Xie and Yuqian Fu and Zhonghao Yang and Shuai Shao and Qihan Ren and Wanying Qu and Yanwei Fu and Yujiu Yang and Jing Shao and Xia Hu and Dongrui Liu},
journal= {arXiv preprint arXiv:2604.02022},
year = {2026}
}