面向长尾视觉识别的平衡信息瓶颈混合模型
计算机视觉与模式识别
2025-09-03 v1 信息论
math.IT
摘要
深度神经网络(Deep Neural Networks,DNNs)在大规模平衡数据上取得了显著的成功。然而,现实世界视觉识别中的数据通常呈长尾分布,带来对 DNN 高效训练和部署的挑战。信息瓶颈(Information Bottleneck,IB)是一种优雅的表示学习方法。本文提出一种平衡信息瓶颈(Balanced Information Bottleneck,BIB)方法,其中集成了损失函数重新平衡和自蒸馏技术于原始 IB 网络之中。BIB 能够在保持完整标签相关信息的前提下,为长尾视觉识别学习充分的表示。为了进一步增强表示学习能力,我们还提出了一种由多个平衡信息瓶颈(Multiple Balanced Information Bottlenecks)混合结构(MBIB),其中不同的 BIB 负责组合来自不同网络层的知识。MBIB 促进了一种端到端学习策略,该策略从信息论角度同时学习表示和分类。我们在常用的长尾数据集上进行实验,包括 CIFAR100-LT、ImageNet-LT 和 iNaturalist 2018。BIB 和 MBIB 均达到了长尾视觉识别的状态最佳性能。
引用
@article{arxiv.2509.01804,
title = {Mixture of Balanced Information Bottlenecks for Long-Tailed Visual Recognition},
author = {Yifan Lan and Xin Cai and Jun Cheng and Shan Tan},
journal= {arXiv preprint arXiv:2509.01804},
year = {2025}
}