中文

MonoLoss:用于可解释单语义表示的训练目标

计算机视觉与模式识别 2026-02-16 v1

摘要

稀疏自编码器 (SAE) 将多语义神经表示——其中神经元对多个无关概念作出响应——分解为捕获单个可解释概念的单语义特征。然而,标准训练目标仅弱ly 鼓励这种分解,现有的单语义性度量标准需要跨所有数据集样本进行成对比较,这在训练和评估期间效率低下。我们研究了最近的 MonoScore 度量标准,并派生出一种单遍算法来计算完全相同的量,但其计算成本随数据集图像数量的增长仅为线性,而非二次。我们在 OpenImagesV7 上实现了最高可达 1200 倍的墙钟速度加速,训练期间为 159 倍,而仅增加约 4% 的每日开销。这使我们能够将 MonoScore 作为训练信号:我们引入单语义性损失 (MonoLoss),一种即插即用的目标函数,直接奖励语义一致的激活,以学习可解释的单语义表示。在所有在 CLIP、SigLIP2 和预训练 ViT 特征上训练的 SAE 中,使用 BatchTopK、TopK 和 JumpReLU SAE,MonoLoss 增加了大多数潜在变量的 MonoScore。MonoLoss 还在所有编码器和 SAE 组合中一致地提高了类纯度 (即潜在变量激活图像所属占其主导类的比例),最大提升将基线纯度从 0.152 提升至 0.723。作为 ResNet-50 和 CLIP-ViT-B/32 微调期间的辅助正则化器,MonoLoss 在 ImageNet-1K 上实现了最高可达 0.6% 的准确率提升,并在标准基准数据集上呈现出单语义激活模式。代码已公开available at https://github.com/AtlasAnalyticsLab/MonoLoss。

关键词

引用

@article{arxiv.2602.12403,
  title  = {MonoLoss: A Training Objective for Interpretable Monosemantic Representations},
  author = {Ali Nasiri-Sarvi and Anh Tien Nguyen and Hassan Rivaz and Dimitris Samaras and Mahdi S. Hosseini},
  journal= {arXiv preprint arXiv:2602.12403},
  year   = {2026}
}

备注

Under Review