AVGZSLNet:通过从多模态嵌入重建标签特征实现音视觉广义零样本学习
计算机视觉与模式识别
2020-11-24 v3 声音
音频与语音处理
摘要
在本文中,我们提出了一种在多模态设定下进行广义零样本学习的新方法,其中测试时存在训练时未见的音视频新类别。我们利用文本嵌入的语义相关性作为零样本学习的手段,通过将音频和视频嵌入与相应的类别标签文本特征空间对齐。我们的方法使用跨模态解码器和复合三元组损失。跨模态解码器强制约束类别标签文本特征可由数据点的音频和视频嵌入重建。这有助于音频和视频嵌入向类别标签文本嵌入靠近。复合三元组损失利用了音频、视频和文本嵌入。它有助于在多模态设定下将同一类的嵌入拉近,并将不同类的嵌入推远。这有助于网络在多模态零样本学习任务上表现更好。重要的是,我们的多模态零样本学习方法即使在测试时缺失某一模态时也能工作。我们在广义零样本分类和检索任务上测试了我们的方法,并表明我们的方法在单一模态以及多模态存在的情况下均优于其他模型。我们通过与先前方法比较并进行各种消融实验来验证我们的方法。
引用
@article{arxiv.2005.13402,
title = {AVGZSLNet: Audio-Visual Generalized Zero-Shot Learning by Reconstructing Label Features from Multi-Modal Embeddings},
author = {Pratik Mazumder and Pravendra Singh and Kranti Kumar Parida and Vinay P. Namboodiri},
journal= {arXiv preprint arXiv:2005.13402},
year = {2020}
}
备注
Accepted in WACV 2021