面向长尾视觉识别的自适应Logit调整损失
计算机视觉与模式识别
2021-09-24 v2
摘要
现实世界中的数据往往呈现长尾标签分布,这给视觉识别中神经网络的训练带来巨大挑战。现有方法主要从数据量即每类样本数量的角度解决该问题。具体而言,它们更关注尾部类,例如对logit施加更大的调整。然而,在训练过程中,数据的数量与难度是两个交织且同等关键的问题。对于某些尾部类,其实例特征明显且具有判别性,也能带来满意的准确率;对于某些头部类,尽管样本充足,但与其他类的高语义相似性和缺乏判别性特征会带来较差的准确率。基于这些观察,我们提出自适应Logit调整损失(ALA Loss),对logit施加自适应调整项。该自适应调整项由两个互补因素组成:1)数量因素,更关注尾部类;2)难度因素,在训练过程中自适应地更关注困难实例。难度因素可缓解对尾部但容易实例的过度优化和对头部但困难实例的欠优化。两因素协同不仅能进一步提升了尾部类的性能,也促进了头部类的准确率。与以往仅关注数据量的logit调整方法不同,ALA Loss从更全面、细粒度和自适应的角度解决长尾问题。大量实验结果表明,我们的方法在包括ImageNet-LT、iNaturalist 2018和Places-LT在内的具有挑战性的识别基准上取得了最先进的性能。
引用
@article{arxiv.2104.06094,
title = {Adaptive Logit Adjustment Loss for Long-Tailed Visual Recognition},
author = {Yan Zhao and Weicong Chen and Xu Tan and Kai Huang and Jihong Zhu},
journal= {arXiv preprint arXiv:2104.06094},
year = {2021}
}