学习用于多标签分类的解耦标签表示
计算机视觉与模式识别
2022-12-06 v1
摘要
尽管已提出多种多标签分类方法,大多数方法仍遵循单标签(多类)分类的特征学习机制,即学习共享的图像特征以分类多个标签。然而,我们发现这种“多标签共享一特征”(OFML)机制不利于学习有判别力的标签特征,并使模型缺乏鲁棒性。我们首次从数学上证明,OFML 机制的劣势在于在最小化交叉熵损失的背景下,最优学习的图像特征无法同时与多个分类器保持高相似性。为解决 OFML 机制的局限,我们引入“一标签一特征”(OFOL)机制,并提出一种新颖的解耦标签特征学习(DLFL)框架,为每个标签学习解耦表示。该框架的特异性在于一个特征解耦模块,其包含可学习的语义查询和一个语义空间交叉注意力(SSCA)模块。具体而言,可学习的语义查询维持同一标签不同图像间的语义一致性。SSCA 模块定位标签相关空间区域,并将定位的区域特征聚合至相应标签特征以实现特征解耦。我们在三项任务的八个数据集上取得了最先进的性能,即多标签分类、行人属性识别和持续多标签学习。
引用
@article{arxiv.2212.01461,
title = {Learning Disentangled Label Representations for Multi-label Classification},
author = {Jian Jia and Fei He and Naiyu Gao and Xiaotang Chen and Kaiqi Huang},
journal= {arXiv preprint arXiv:2212.01461},
year = {2022}
}
备注
17 pages, 9 figures