中文

突破式机械化智能体安全:从安全基准到输入审查

人工智能 2025-06-23 v3

摘要

机械化智能体在众多领域展现出巨大的潜力,确保其行为安全是其广泛部署的基本前提。然而,现有研究主要致力于通用大型语言模型的安全,缺乏针对机械化智能体的安全基准和输入审查的专门方法。为弥合这一差距,本文引入一种新型输入审查框架,专为保障机械化智能体而设计。该框架涵盖整个流程,包括分类学定义、数据集构建、审查器架构、模型训练和严格评估。值得注意的是,我们提出了 EAsafetyBench—a 个精心构建的专为机械化智能体设计的安全基准,以促进其训练和严格评估。此外,我们提出了 Pinpoint—a 一种创新的解耦式输入审查方案,利用掩码注意力机制有效隔离并缓解功能提示词对审查任务的影响。在多样化基准数据集和模型上的大量实验表明,所提方法的可行性和有效性。结果显示,我们的方法在各种基准上的平均检测准确率达到 94.58%,显著优于现有最先进技术,并实现了每实例仅 0.002 秒的卓越审查处理速度。

关键词

引用

@article{arxiv.2504.15699,
  title  = {Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation},
  author = {Ning Wang and Zihan Yan and Weiyang Li and Chuan Ma and He Chen and Tao Xiang},
  journal= {arXiv preprint arXiv:2504.15699},
  year   = {2025}
}

备注

9 pages