SafePro:评估专业级AI代理的安全性
人工智能
2026-01-14 v2
摘要
大型语言模型(Large Language Model)代理正快速演进,从简单的对话助手发展为能够在各个领域执行复杂专业任务的自主系统。尽管这些进步为获得显著的生产力增益带来了希望,但也引入了尚未充分探讨的关键安全风险。现有的安全评估主要关注简单日常任务,无法捕捉专业环境下复杂决策过程和不一致行为潜在后果。为填补这一差距,我们引入SafePro,一个旨在评估执行专业活动的AI代理安全对齐的全面基准测试。SafePro具备一个由严格的迭代创建和审查过程构建的高复杂度任务数据集,覆盖多个具有安全风险的专业领域。我们评估了最先进的AI模型,揭示了显著的安全漏洞,发现专业情境下的新型不安全行为。我们进一步表明,这些模型在执行复杂专业任务时表现出不足的安全判断和弱安全对齐。此外,我们研究了针对这些情境下代理安全的缓解策略,观察到鼓舞人心的改进。总之,我们的发现凸显了针对下一代专业AI代理制定针对性强的安全机制的紧迫需求。
引用
@article{arxiv.2601.06663,
title = {SafePro: Evaluating the Safety of Professional-Level AI Agents},
author = {Kaiwen Zhou and Shreedhar Jangam and Ashwin Nagarajan and Tejas Polu and Suhas Oruganti and Chengzhi Liu and Ching-Chen Kuo and Yuting Zheng and Sravana Narayanaraju and Xin Eric Wang},
journal= {arXiv preprint arXiv:2601.06663},
year = {2026}
}