面向视频广义视听零样本分类与检索的协调联合多模态嵌入
计算机视觉与模式识别
2019-10-22 v1 多媒体
声音
音频与语音处理
摘要
我们提出一种视听多模态方法,用于视频的零样本学习(ZSL)分类与检索任务。ZSL 在近年已被广泛研究,但主要局限于视觉模态与图像。我们证明音频与视觉模态对视频的 ZSL 均十分重要。由于目前尚无研究该任务的数据集,我们基于现有大规模音频事件数据集构建了一个包含 33 类、156,416 个视频的相应多模态数据集。我们通过实验表明,在使用嵌入学习方法的多种模态扩展时,加入音频模态可提升零样本分类与检索两项任务的性能。我们还提出一种利用联合学习的模态注意力网络预测“主导”模态的新方法。我们在半监督设定下学习注意力,因此无需任何额外的模态显式标注。我们给出了模态特定注意力的定性验证,其也能成功泛化至未见测试类。
引用
@article{arxiv.1910.08732,
title = {Coordinated Joint Multimodal Embeddings for Generalized Audio-Visual Zeroshot Classification and Retrieval of Videos},
author = {Kranti Kumar Parida and Neeraj Matiyali and Tanaya Guha and Gaurav Sharma},
journal= {arXiv preprint arXiv:1910.08732},
year = {2019}
}
备注
To appear in WACV 2020, Project Page: https://cse.iitk.ac.in/users/kranti/avzsl.html