中文

内外测度:通过视觉 Transformer 的内部机制衡量泛化

机器学习 2026-04-10 v1 计算机视觉与模式识别

摘要

可靠的泛化指标是机器学习模型评估的基本要求。尤其是在标注目标数据稀缺的高风险应用场景中,评估模型在分布迁移下的泛化性能迫切需要。我们关注两种实际场景:(1)部署前,如何为 unlabeled 目标数据选择最佳模型?(2)部署后,如何监控分布迁移下的模型性能?这两种情况的核心需求都是可靠且无标签的代理指标。然而,现有的代理指标如模型置信度或准确率-在-线指标,往往不可靠,因为它们仅评估模型输出,忽略了产生这些输出的内部机制。我们提出新视角:将模型的内部工作(即电路)作为泛化性能的预测指标。利用电路发现技术,我们从中提取内部表征之间的因果相互作用作为电路,从而推导出两种针对两个实际场景的指标。(1)部署前,我们引入依赖深度偏置(Dependency Depth Bias),衡量不同模型在目标数据上的泛化能力。(2)部署后,我们提出电路迁移得分(Circuit Shift Score),预测模型在不同分布迁移下的泛化。对于各种任务,这两个指标均显示出显著提升的泛化性能相关性,分别比现有代理指标提高了 13.4% 和 34.1%。我们的代码已公开于 https://github.com/deep-real/GenCircuit。

关键词

引用

@article{arxiv.2604.08192,
  title  = {Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings},
  author = {Yunxiang Peng and Mengmeng Ma and Ziyu Yao and Xi Peng},
  journal= {arXiv preprint arXiv:2604.08192},
  year   = {2026}
}

备注

CVPR 2026(Highlight)