通过电路复制优化冻结视觉 Transformer 的推理路径以进行海洋物种分类
计算机视觉与模式识别
2026-04-07 v1 人工智能
机器学习
摘要
自动化水下物种分类受到标注成本和环境变化的限制,这限制了全监督模型的可迁移性。最近的研究表明,自监督视觉基础模型的冻结嵌入已经为海洋图像分类提供了一个强大的标签高效基线。在此,我们研究是否可以在推理时改进这种冻结嵌入机制,而无需微调或更改模型权重。我们应用了电路复制(Circuit Duplication),这是一种最初为大型语言模型提出的推理时方法,在前向传播过程中,选定的 Transformer 层范围会被遍历两次。我们在类别不平衡的 AQUA20 基准上,使用冻结的 DINOv3 嵌入,在两种设置下进行评估:全局电路选择,即为整个数据集选择一个单一的复制电路;以及类别特定电路选择,即每个物种可能获得不同的最优电路。两种设置都使用简单的半监督下游分类器。电路复制一致地改进了标准的冻结前向传播。在最大标签预算下,类别特定选择达到了 0.875 的宏 F1 分数,将与全监督 ConvNeXt 基准(0.889)的差距缩小到 1.4 个百分点,且无需任何基于梯度的训练。有四个物种超过了其全监督参考值,其中章鱼的 F1 分数提高了 +12.1 个百分点。在所有预算下,大约 75% 的类别偏好类别特定电路,表明存在真正的类别依赖性收益。据我们所知,这是电路复制首次应用于计算机视觉。
引用
@article{arxiv.2604.03428,
title = {Inference-Path Optimization via Circuit Duplication in Frozen Visual Transformers for Marine Species Classification},
author = {Thomas Manuel Rost},
journal= {arXiv preprint arXiv:2604.03428},
year = {2026}
}
备注
pre study, more ablations to come