中文

BlueGlass:复合型 AI 安全框架

人工智能 2025-07-15 v1

摘要

随着AI系统日益可能且普及,确保这些系统的安全性至关重要。然而,现有的安全工具通常针对模型安全的不同方面,无法孤立提供全面保障,凸显了需要集成和复合方法的需求。本文介绍了 BlueGlass—a 一个旨在促进复合型 AI 安全工作流程的框架,通过提供统一的基础设施,使能够整合和组合 operate across model internals and outputs 的多样化安全工具。进一步地,为演示该框架的实用性,我们在视觉-语言模型上进行了三个面向安全的分析:(1) 分布式评估,揭示跨分布的性能权衡和潜在失效模式;(2) 基于探针的分析,突出通过相位转变所见的层次动态共享学习;(3) 稀疏自编码器识别可解释概念。更广泛地,该工作为构建更健壮和可靠的AI系统贡献了基础设施和发现。

关键词

引用

@article{arxiv.2507.10106,
  title  = {BlueGlass: A Framework for Composite AI Safety},
  author = {Harshal Nandigramwar and Syed Qutub and Kay-Ulrich Scholl},
  journal= {arXiv preprint arXiv:2507.10106},
  year   = {2025}
}

备注

Accepted at ICML 2025 [Actionable Interpretability Workshop]