中文

让我成为专家:从通用黑箱模型蒸馏到语义分割专用模型

计算机视觉与模式识别 2025-09-03 v1

摘要

人工智能即服务(AIaaS)的兴起通过应用程序编程接口(API)使访问预训练模型民主化,但也提出了一个基本问题:在黑箱模型不暴露其权重、训练数据或 logits 的约束下(在此约束下当前的域适应范式不实用),如何有效地使用本地模型进行训练?为应对这一挑战,我们引入了黑箱蒸馏(B2D)设定,使本地模型适应在现实约束下成为可能:(1) API 模型是开放词汇的并在大规模通用数据上训练,(2) 访问仅限于 one-hot 预测。我们发现开放词汇模型对输入分辨率表现出显著的敏感性,不同的对象类别在不同的尺度上被最优分割,这一限制被称为"分辨率诅咒"。我们的方法 ATtention-Guided sCaler(ATGC)通过利用 DINOv2 注意力图动态选择黑箱模型推理的最优尺度来解决这一挑战。ATGC 以熵为注意力图评分,以识别用于伪标签标注的信息量充足的尺度,从而实现有效的蒸馏。实验表明,在仅需要 one-hot API 预测的条件下,在多个数据集上均取得了显著的改进。我们的代码可在 https://github.com/yasserben/ATGC 获取。

关键词

引用

@article{arxiv.2509.00509,
  title  = {Make me an Expert: Distilling from Generalist Black-Box Models into Specialized Models for Semantic Segmentation},
  author = {Yasser Benigmim and Subhankar Roy and Khalid Oublal and Imad Eddine Marouf and Slim Essid and Vicky Kalogeiton and Stéphane Lathuilière},
  journal= {arXiv preprint arXiv:2509.00509},
  year   = {2025}
}

备注

Github repo : https://github.com/yasserben/ATGC