基于语义图嵌入与跨模态注意力的多标签分类方法
计算机视觉与模式识别
2020-03-30 v2
摘要
多标签图像与视频分类是计算机视觉中基础且具有挑战性的任务。主要挑战在于捕捉标签间的空间或时间依赖关系,以及发现每类判别性特征的位置。为克服这些挑战,我们提出使用带语义图嵌入的跨模态注意力进行多标签分类。基于构建的标签图,我们提出一种基于邻接的相似图嵌入方法来学习语义标签嵌入,从而显式利用标签关系。随后,在所学标签嵌入的指导下生成我们新颖的跨模态注意力图。在两个多标签图像分类数据集(MS-COCO和NUS-WIDE)上的实验表明,我们的方法优于其他现有最优方法。此外,我们在一个大型多标签视频分类数据集(YouTube-8M Segments)上验证了方法,评估结果证明了我们方法的泛化能力。
引用
@article{arxiv.1912.07872,
title = {Cross-Modality Attention with Semantic Graph Embedding for Multi-Label Classification},
author = {Renchun You and Zhiyao Guo and Lei Cui and Xiang Long and Yingze Bao and Shilei Wen},
journal= {arXiv preprint arXiv:1912.07872},
year = {2020}
}
备注
Accepted by AAAI2020