中文

STARS:基于请求条件调用的技能触发审计

人工智能 2026-04-14 v1

摘要

自主语言模型智能体日益依赖可安装技能和工具以完成用户任务。静态技能审计可在部署前暴露能力表面,但无法确定特定调用在当前用户请求和运行上下文下是否安全。我们因此将技能调用审计作为连续风险估计问题:给定用户请求、候选技能和运行上下文,预测得分以支持在应用硬性干预前进行排序和分流。我们引入STARS,结合静态能力先验、请求条件调用风险模型和校准的风险融合策略。为评估此设定,我们构建SIA-Bench,包含3000条调用记录,具群组安全划分、血统元数据、运行上下文、规范动作标签及派生连续风险目标。在隐式提示注入攻击的锁定分布外测试集上,校准融合达到0.439的高风险AUPRC,优于0.405的上下文评分器和0.380的最强静态基线;而上下文评分器在校准性上更佳,0.289的预期校准误差。在锁定分布内测试集上,收益较小,静态先验仍有用。因此,主张局限为:请求条件审计最有价值为作为调用时风险评分和分流层,而非静态筛选的替代品。代码已公开于https://github.com/123zgj123/STARS。

关键词

引用

@article{arxiv.2604.10286,
  title  = {STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems},
  author = {Guijia Zhang and Shu Yang and Xilin Gong and Di Wang},
  journal= {arXiv preprint arXiv:2604.10286},
  year   = {2026}
}