中文

基于合成数据构建通用智能体系统的基础护栏

机器学习 2025-10-14 v1 人工智能 计算与语言

摘要

尽管 LLM 智能体能够规划多步任务,但在规划阶段——在任何动作被执行之前——进行干预通常是最安全的风险防范方式,因为某些风险一旦付诸实施便可能导致严重后果。然而,现有的护栏大多在执行后运作,这种方式难以扩展,且在规划层面缺乏可控监督的空间。为应对这一挑战,我们指出了当前研究中三个关键缺口:数据缺口、模型缺口与评估缺口。为填补数据缺口,我们提出了 AuraGen——一个可控的合成引擎,其能够 (i) 合成良性轨迹,(ii) 注入带有校准难度的类别化风险,(iii) 通过自动化奖励模型过滤输出,从而为执行前安全生成大规模且可靠的语料。为填补守护模型缺口,我们提出了基础护栏 Safiron,它结合了跨规划器适配器与一个紧凑的守护模型。适配器统一不同的输入格式,而 Safiron 标记风险案例、分配风险类型并生成理由;Safiron 通过两阶段训练与广泛探索的数据配方,在不同场景间实现了稳健的迁移。为填补评估缺口,我们发布了 Pre-Exec Bench,一个涵盖多样化工具与分支轨迹的真实基准,用于在经过人工核验的场景中衡量检测、细粒度分类、解释以及跨规划器泛化能力。大量实验表明,所提出的护栏在 Pre-Exec Bench 上相较于强基线取得了持续的性能提升,消融实验进一步提炼出可操作的实践,为构建更安全的智能体系统提供了切实可行的模板。

关键词

引用

@article{arxiv.2510.09781,
  title  = {Building a Foundational Guardrail for General Agentic Systems via Synthetic Data},
  author = {Yue Huang and Hang Hua and Yujun Zhou and Pengcheng Jing and Manish Nagireddy and Inkit Padhi and Greta Dolcetti and Zhangchen Xu and Subhajit Chaudhury and Ambrish Rawat and Liubov Nedoshivina and Pin-Yu Chen and Prasanna Sattigeri and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2510.09781},
  year   = {2025}
}