中文

UNBOX: 使用自然语言揭示黑箱视觉模型

计算机视觉与模式识别 2026-04-16 v2 人工智能

摘要

确保开放世界视觉识别系统的可信度需要模型具备可解释性、公平性以及对分布迁移的鲁棒性。然而,现代视觉系统日益以专有黑箱API形式部署,仅暴露输出概率,隐藏架构、参数、梯度和训练数据。这种不透明性阻碍了有意义的审计、偏见检测和故障分析。现有的解释方法假设白箱或灰箱访问权限或对训练分布的了解,在这些现实场景中无法使用。我们引入UNBOX,一个在完全数据自由、梯度自由和反向传播自由约束下进行的类别级模型剖析框架。UNBOX利用大语言模型和文本到图像扩散模型,将激活最大化重新诠释为仅由输出概率驱动的纯语义搜索方法。该方法产生人类可解释的文本描述符,这些描述符最大化激活每个类别,从而揭示模型隐式学习的概念、反映的训练分布以及潜在的偏见来源。我们在ImageNet-1K、Waterbirds和CelebA上进行评估,通过语义忠诚度测试、视觉特征相关性分析和切片发现审计。尽管在最严格的黑箱约束下,UNBOX仍能与领先的白箱可解释性方法竞争。表明,在不获取任何内部访问权限的情况下,仍可恢复对模型内部推理的有意义见解,从而实现更可信和可 accountability的视觉识别系统。

关键词

引用

@article{arxiv.2603.08639,
  title  = {UNBOX: Unveiling Black-box visual models with Natural-language},
  author = {Simone Carnemolla and Chiara Russo and Simone Palazzo and Quentin Bouniot and Daniela Giordano and Zeynep Akata and Matteo Pennisi and Concetto Spampinato},
  journal= {arXiv preprint arXiv:2603.08639},
  year   = {2026}
}

备注

Under review at IJCV