中文

BeSafe-Bench: 揭示情境智能体在功能环境中的行为安全风险

人工智能 2026-03-30 v1

摘要

大规模多模态模型(LMMs)的快速发展使智能体能够执行复杂的数字和物理任务,但将其部署为自主决策者引入了大量的非故意行为安全风险。然而,全面安全基准的缺失是一个主要瓶颈,因为现有的评估依赖低保真度环境、模拟API或范围狭窄的任务。为了填补这一空白,我们提出了BeSafe-Bench(BSB),一个用于揭示情境智能体在功能环境中行为安全风险的基准,涵盖四个代表性领域:Web、移动、嵌入VLM和嵌入VLA。使用功能环境,我们通过将任务与九类安全关键风险增强来构建多样化的指令空间,并采用结合基于规则的检查与LLM-as-a-judge推理的混合评估框架来评估真实环境影响。评估13个流行的智能体揭示了一个令人担忧的趋势:即使表现最好的智能体在完全遵守安全约束的情况下完成的任务也不到40%,而强大的任务表现经常伴随严重的安全违规。这些发现强调了在真实世界环境中部署智能体系统之前需要改进安全对齐的紧迫性。

关键词

引用

@article{arxiv.2603.25747,
  title  = {BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments},
  author = {Yuxuan Li and Yi Lin and Peng Wang and Shiming Liu and Xuetao Wei},
  journal= {arXiv preprint arXiv:2603.25747},
  year   = {2026}
}